-
发布超轻量 OCR 系统 PP-OCRv3:中英文、纯英文以及多语言场景精度再提升 5% - 11%!
-
发布半自动标注工具 PPOCRLabelv2:新增表格文字图像、图像关键 信息抽取 任务和不规则文字图像的标注功能。
-
发布 OCR 产业落地工具集:打通 22 种训练部署软硬件环境与方式,覆盖企业 90% 的训练部署环境需求。
-
发布业界首个交互式OCR开源电子书《动手学OCR》,覆盖OCR全栈技术的前沿理论与代码实践,并配套教学视频。
官网地址:https://www.paddlepaddle.org.cn
Gitee: https://gitee.com/paddlepaddle/PaddleOCR
GitHub:https://github.com/PaddlePaddle/PaddleOCR
一、PP-OCRv3 优化策略详细解读
-
中文场景,相比 PP-OCRv2,中文模型提升超 5%;
-
英文数字场景,相比 PP-OCRv2,英文数字模型提升 11%;
-
多语言场景,优化 80 + 语种识别效果,平均 准确率 提升超 5%。
1. 检测模块
-
LK-PAN:大 感受野 的 PAN 结构
-
DML:教师模型互学习策略
-
RSE-FPN:残差 注意力机制 的 FPN 结构
2. 识别模块
-
SVTR_LCNet:轻量级文本识别网络
-
GTC:Attention 指导 CTC 训练策略
-
TextConAug:挖掘文字上下文信息的数据增广策略
-
TextRotNet:自监督的预训练模型
-
UDML:联合互学习策略
-
UIM:无标注 数据挖掘 方案
二、PPOCRLabelv2 多项重磅 更新
-
新增标注类型 :表格标注、关键信息标注、不规则文字图像的标注(印章、弯曲文本等)
-
新增功能 :锁定框、图像旋转、数据集划分、批量处理等
-
易用性提升 :新增 whl 包安装、以及优化多处标注体验
三、OCR 产业落地工具集
四、PP-OCRv3 优化策略详解
1. 检测模块优化策略
2. 识别模块优化策略
3. 整体效果对比