中文

LOCR:用于光学字符识别的位置引导 Transformer

计算机视觉与模式识别 2024-03-05 v1 人工智能 计算与语言

摘要

学术文档包含大量文本、公式、表格和图形,需要全面理解才能实现准确的光学字符识别 (OCR)。尽管端到端 OCR 方法比基于布局的方法具有更高的准确性,但它们经常面临严重的重复问题,尤其是在分布外 (OOD) 文档的复杂布局中。为了解决这个问题,我们提出了 LOCR,这是一种在自回归过程中将位置引导集成到 Transformer 架构中的模型。我们在一个包含来自 125K 学术文档页面的超过 7700 万个文本-位置对的数据集上训练该模型,其中包括单词、表格和数学符号的边界框。LOCR 能够熟练处理各种格式元素,并以 Markdown 语言生成内容。在我们由 arXiv 构建的测试集中,以编辑距离、BLEU、METEOR 和 F-measure 衡量,它优于所有现有方法。LOCR 还将 arXiv 数据集中的重复频率从 4.4% 的页面降低到 0.5%,在 OOD 量子物理文档中从 13.2% 降低到 1.3%,在 OOD 营销文档中从 8.1% 降低到 1.8%。此外,LOCR 具有交互式 OCR 模式,通过来自人类的少量位置提示,促进复杂文档的生成。

关键词

引用

@article{arxiv.2403.02127,
  title  = {LOCR: Location-Guided Transformer for Optical Character Recognition},
  author = {Yu Sun and Dongzhan Zhou and Chen Lin and Conghui He and Wanli Ouyang and Han-Sen Zhong},
  journal= {arXiv preprint arXiv:2403.02127},
  year   = {2024}
}