PP-OCR:一种实用的超轻量OCR系统
计算机视觉与模式识别
2020-10-16 v3
摘要
光学字符识别(OCR)系统已广泛应用于各种应用场景,如办公自动化(OA)系统、工厂自动化、在线教育、地图制作等。然而,由于文本外观的多样性和对计算效率的需求,OCR仍然是一项具有挑战性的任务。在本文中,我们提出了一种实用的超轻量OCR系统,即PP-OCR。PP-OCR的整体模型大小在识别6622个汉字时为仅3.5M,在识别63个字母数字符号时为2.8M。我们引入了一系列策略,以增强模型能力或减小模型规模。同时也提供了基于真实数据的相应消融实验。此外,发布了若干个用于中英文识别的预训练模型,包括文本检测器(使用了97K图像)、方向分类器(使用了600K图像)以及文本识别器(使用了17.9M图像)。除此之外,所提出的PP-OCR还在其他几种语言识别任务中进行了验证,包括法语、韩语、日语和德语。上述所有模型均已开源,代码可在GitHub仓库中获取,即 https://github.com/PaddlePaddle/PaddleOCR。
引用
@article{arxiv.2009.09941,
title = {PP-OCR: A Practical Ultra Lightweight OCR System},
author = {Yuning Du and Chenxia Li and Ruoyu Guo and Xiaoting Yin and Weiwei Liu and Jun Zhou and Yifan Bai and Zilin Yu and Yehua Yang and Qingqing Dang and Haoshuang Wang},
journal= {arXiv preprint arXiv:2009.09941},
year = {2020}
}