中文

TextOCR:面向任意形状场景文本的大规模端到端推理

计算机视觉与模式识别 2021-05-13 v1

摘要

TextVQA与TextCaps数据集所需的基于场景文本的推理的一个关键组件,涉及使用光学字符识别(OCR)系统检测并识别图像中存在的文本。当前系统受限于这些数据集缺乏真值文本标注,以及缺乏真实图像上的场景文本检测与识别数据集,这阻碍了OCR领域的进展,并使得基于场景文本的推理无法脱离OCR系统单独评估。在本文中,我们提出TextOCR,一种任意形状场景文本检测与识别方法,其从TextVQA数据集的真实图像上收集了90万标注词。我们表明当前最先进的文本识别(OCR)模型在TextOCR上表现不佳,且在其上训练有助于在其他多个OCR数据集上取得最先进性能。我们使用TextOCR训练的OCR模型创建PixelM4C模型,该模型能以端到端方式对图像进行基于场景文本的推理,使我们得以重新审视若干设计选择,从而在TextVQA数据集上取得新的最先进性能。

关键词

引用

@article{arxiv.2105.05486,
  title  = {TextOCR: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text},
  author = {Amanpreet Singh and Guan Pang and Mandy Toh and Jing Huang and Wojciech Galuba and Tal Hassner},
  journal= {arXiv preprint arXiv:2105.05486},
  year   = {2021}
}

备注

To appear in CVPR 2021. 15 pages, 7 figures. First three authors contributed equally. More info at https://textvqa.org/textocr