PP-OCRv3:为改进超轻量 OCR 系统的更多尝试
计算机视觉与模式识别
2022-06-15 v2
摘要
光学字符识别(OCR)技术已广泛应用于各种场景,如图 1 所示。设计一个实用的 OCR 系统仍是一项有意义但具挑战性的任务。在先前工作中,兼顾效率与精度,我们提出了实用的超轻量 OCR 系统(PP-OCR)及其优化版本 PP-OCRv2。为了进一步提升 PP-OCRv2 的性能,本文提出更具鲁棒性的 OCR 系统 PP-OCRv3。PP-OCRv3 在 PP-OCRv2 基础上从 9 个方面升级了文本检测模型与文本识别模型。对于文本检测器,我们引入了具有大感受野的 PAN 模块 LK-PAN、具有残差注意力机制的 FPN 模块 RSE-FPN,以及 DML 蒸馏策略。对于文本识别器,基础模型由 CRNN 替换为 SVTR,并引入了轻量文本识别网络 SVTR LCNet、由注意力引导的 CTC 训练、数据增强策略 TextConAug、通过自监督 TextRotNet 得到的更好预训练模型、UDML 以及 UIM 以加速模型并提升效果。在真实数据上的实验表明,在可比推理速度下 PP-OCRv3 的 hmean 比 PP-OCRv2 高 5%。上述所有模型均已开源,代码可在由 PaddlePaddle 提供支持的 GitHub 仓库 PaddleOCR 中获取。
引用
@article{arxiv.2206.03001,
title = {PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System},
author = {Chenxia Li and Weiwei Liu and Ruoyu Guo and Xiaoting Yin and Kaitao Jiang and Yongkun Du and Yuning Du and Lingfeng Zhu and Baohua Lai and Xiaoguang Hu and Dianhai Yu and Yanjun Ma},
journal= {arXiv preprint arXiv:2206.03001},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2109.03144