

应用百度飞桨PaddleOCR进行本地文字识别, 也可以做pdf等文件上文字识别。
二话不说,先来上几个图。




其中截图中的ppocr INFO: [[[247.0, 866.0], [334.0, 864.0], [334.0, 891.0], [248.0, 892.0]], ('症状消失', 0.9889488220214844)]中的
[[[247.0, 866.0], [334.0, 864.0], [334.0, 891.0], [248.0, 892.0]], ('症状消失', 0.9889488220214844)]分别表示识别到的文本框位置,识别到的文字及识别置信度(一般不小于0.8即为可信的)
PaddleOCR 参考 PaddlePaddle / PaddleOCR
PaddleOCR 快速开始,命令行一行搞定
首先需要python环境,然后本地pip安装paddlepaddle, paddleocr模块, 然后可以在命令行下测试paddleocr是否可以正常调用。

然后相当于在影刀中使用“运行DOS命令”再调用此功能,在返回的output_info中识别结果通过正则等剥离出来就好了。
paddleocr --image_dir ./imgs/11.jpg --use_angle_cls true --use_gpu false
PaddleOCR也可以自己训练识别模型,然后应用模型进行识别。这里使用的是默认的PP-OCRv3,此外还有PP-OCRv2,PP-OCR
可以通过参数--ocr_version来指定。
在python环境下也可以将paddleocr通过诸如FLASK等封装为本地api,以供其他应用调用。
但很遗憾,影刀里面一直没能安装上paddle环境,这个问题我也提出来了(想在影刀里面把PaddleOCR用起来,但导入paddle模块一直没成功?),期待大神来解答!