一、项目简介
今天分享一个基于 python + opencv 的文档扫描与ocr识别系统。这个项目可以自动检测文档边缘、进行透视变换校正,并使用 tesseract ocr 提取文档中的文字内容。
项目效果:
- 输入:一张倾斜的文档照片
- 输出:校正后的正面文档视图 + 识别出的文字内容
二、项目演示
2.1 扫描流程
- 原始图像 → 读取文档照片
- 边缘检测 → 识别文档轮廓
- 透视变换 → 校正为正面视图
- 二值化处理 → 便于ocr识别
2.2 ocr识别流程
- 读取扫描图像 → 读取处理后的文档图像
- 图像预处理 → 二值化或中值模糊
- 文字识别 → 使用tesseract提取文字
- 输出结果 → 打印识别的文字内容
三、技术栈
| 技术 | 用途 |
|---|---|
| python | 编程语言 |
| opencv | 图像处理核心库 |
| numpy | 数值计算 |
| tesseract ocr | 文字识别引擎 |
| pytesseract | tesseract python封装 |
| pillow | 图像读取 |
四、项目结构
scan/
├── scan.py # 文档扫描核心模块
├── test.py # ocr文字识别模块
├── scan.jpg # 默认输入/输出图像
├── images/ # 示例图像目录
│ ├── page.jpg # 示例文档图像
│ └── receipt.jpg # 示例收据图像
└── tesseract-ocr/ # tesseract ocr引擎(内置)
五、核心代码详解
5.1 文档扫描模块 (scan.py)
5.1.1 角点排序函数
def order_points(pts):
# 初始化4个坐标点
rect = np.zeros((4, 2), dtype = "float32")
# 按顺序找到对应坐标:左上、右上、右下、左下
s = pts.sum(axis = 1)
rect[0] = pts[np.argmin(s)] # 左上:x+y最小
rect[2] = pts[np.argmax(s)] # 右下:x+y最大
diff = np.diff(pts, axis = 1)
rect[1] = pts[np.argmin(diff)] # 右上:x-y最小
rect[3] = pts[np.argmax(diff)] # 左下:x-y最大
return rect原理:通过计算坐标点的和与差来确定四个角点的位置,确保顺序正确。
5.1.2 透视变换函数
def four_point_transform(image, pts):
rect = order_points(pts)
(tl, tr, br, bl) = rect
# 计算目标宽度和高度
widtha = np.sqrt(((br[0] - bl[0]) ** 2) + ((br[1] - bl[1]) ** 2))
widthb = np.sqrt(((tr[0] - tl[0]) ** 2) + ((tr[1] - tl[1]) ** 2))
maxwidth = max(int(widtha), int(widthb))
heighta = np.sqrt(((tr[0] - br[0]) ** 2) + ((tr[1] - br[1]) ** 2))
heightb = np.sqrt(((tl[0] - bl[0]) ** 2) + ((tl[1] - bl[1]) ** 2))
maxheight = max(int(heighta), int(heightb))
# 变换后对应坐标位置
dst = np.array([
[0, 0],
[maxwidth - 1, 0],
[maxwidth - 1, maxheight - 1],
[0, maxheight - 1]], dtype = "float32")
# 计算变换矩阵
m = cv2.getperspectivetransform(rect, dst)
warped = cv2.warpperspective(image, m, (maxwidth, maxheight))
return warped原理:根据原始四个角点和目标矩形,计算透视变换矩阵,将倾斜的文档校正为正面视图。
5.1.3 主流程
# 1. 读取图像并缩放
image = cv2.imread(args["image"])
ratio = image.shape[0] / 500.0
orig = image.copy()
image = resize(orig, height = 500)
# 2. 边缘检测
gray = cv2.cvtcolor(image, cv2.color_bgr2gray)
gray = cv2.gaussianblur(gray, (5, 5), 0)
edged = cv2.canny(gray, 75, 200)
# 3. 轮廓检测
cnts = cv2.findcontours(edged.copy(), cv2.retr_list, cv2.chain_approx_simple)[0]
cnts = sorted(cnts, key=cv2.contourarea, reverse=true)[:5]
# 4. 找到四边形轮廓
for c in cnts:
peri = cv2.arclength(c, true)
approx = cv2.approxpolydp(c, 0.02 * peri, true)
if len(approx) == 4:
screencnt = approx
break
# 5. 透视变换和二值化
warped = four_point_transform(orig, screencnt.reshape(4, 2) * ratio)
warped = cv2.cvtcolor(warped, cv2.color_bgr2gray)
ref = cv2.threshold(warped, 100, 255, cv2.thresh_binary)[1]
cv2.imwrite('scan.jpg', ref)步骤说明:
- 读取图像并按比例缩放
- 灰度化 → 高斯模糊 → canny边缘检测
- 查找轮廓并按面积排序
- 通过轮廓逼近找到四边形(文档边缘)
- 进行透视变换和二值化处理
5.2 ocr识别模块 (test.py)
from pil import image
import pytesseract
import cv2
import os
preprocess = 'blur' # thresh
image = cv2.imread('scan.jpg')
gray = cv2.cvtcolor(image, cv2.color_bgr2gray)
# 预处理
if preprocess == "thresh":
gray = cv2.threshold(gray, 0, 255, cv2.thresh_binary | cv2.thresh_otsu)[1]
elif preprocess == "blur":
gray = cv2.medianblur(gray, 3)
# 调用tesseract ocr
filename = "{}.png".format(os.getpid())
cv2.imwrite(filename, gray)
pytesseract.pytesseract.tesseract_cmd = r'./tesseract-ocr/tesseract.exe'
text = pytesseract.image_to_string(image.open(filename))
print(text)
os.remove(filename)预处理方式:
thresh:二值化处理,适用于对比度较高的图像blur:中值模糊处理,适用于有噪点的图像
六、安装与运行
6.1 安装依赖
pip install numpy opencv-python pytesseract pillow
6.2 运行文档扫描
# 使用默认图像 python scan.py # 指定输入图像 python scan.py -i images/page.jpg
6.3 运行ocr识别
python test.py
七、使用技巧
7.1 图像采集建议
- 光线充足:避免阴影和反光
- 对比度明显:文档与背景颜色差异大
- 边缘清晰:文档边界完整可见
- 适度距离:不要太近或太远
7.2 参数调整
- canny边缘检测阈值:
cv2.canny(gray, 75, 200),根据图像调整 - 轮廓逼近精度:
0.02 * peri,值越小轮廓越接近原始 - 二值化阈值:
cv2.threshold(warped, 100, 255, ...),根据图像亮度调整
八、常见问题
q1: ocr识别率低怎么办?
a:尝试以下方法:
- 确保图像清晰,对比度高
- 调整预处理方式(
thresh或blur) - 检查图像是否倾斜或模糊
- 增加训练数据(添加中文训练数据支持中文识别)
q2: 轮廓检测不到文档边缘?
a:可能原因:
- 文档与背景对比度不足
- 图像质量太差
- 调整canny边缘检测阈值
- 尝试调整轮廓逼近参数
q3: 如何支持中文识别?
a:下载中文训练数据 chi_sim.traineddata,放入 tesseract-ocr/tessdata/ 目录,然后修改代码:
text = pytesseract.image_to_string(image.open(filename), lang='chi_sim')
九、项目扩展
批量处理:支持批量扫描多个文档
图形界面:添加pyqt或tkinter界面
实时扫描:使用摄像头实时扫描
多语言支持:添加多种语言的ocr训练数据
文档分类:根据内容自动分类文档
十、总结
本文介绍了一个基于 python + opencv 的文档扫描与ocr识别系统,通过边缘检测、轮廓提取、透视变换和ocr识别等技术,实现了从文档照片到文字提取的完整流程。
核心知识点:
- 图像预处理(灰度化、高斯模糊、边缘检测)
- 轮廓检测与筛选
- 透视变换校正
- tesseract ocr文字识别
希望这个项目对大家有所帮助,如果有任何问题或建议,欢迎在评论区留言交流!
发表评论