通用OCR理论:通过统一端到端模型实现OCR-2.0
计算机视觉与模式识别
2024-09-04 v1
摘要
传统OCR系统(OCR-1.0)正日益无法满足人们的需求,因为对人造光学字符的智能处理需求日益增长。本文我们统一地将所有人造光学信号(例如普通文本、数学/分子公式、表格、图表、乐谱以及几何图形)称为“字符”,并提出了通用OCR理论(General OCR Theory)以及一个优秀模型——GOT,以推动OCR-2.0的到来。GOT拥有5.8亿参数,是一种统一、优雅且端到端的模型,由高压缩编码器和长上下文解码器组成。作为OCR-2.0模型,GOT能够在各种OCR任务中处理上述所有“字符”。在输入侧,模型支持常用的场景式和文档式图像,包括切片和整页两种样式。在输出侧,GOT可以通过简单提示生成普通或格式化结果(markdown/tikz/smiles/kern)。此外,模型还享有交互式OCR功能,即支持通过坐标或颜色实现区域级识别。我们还将动态分辨率和多页OCR技术适用于GOT以提高实用性。在实验中,我们提供了充分的结果来证明我们模型的优越性。
引用
@article{arxiv.2409.01704,
title = {General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model},
author = {Haoran Wei and Chenglong Liu and Jinyue Chen and Jia Wang and Lingyu Kong and Yanming Xu and Zheng Ge and Liang Zhao and Jianjian Sun and Yuang Peng and Chunrui Han and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2409.01704},
year = {2024}
}