中文

TrOCR:基于Transformer与预训练模型的 Optical Character Recognition

计算与语言 2022-09-07 v5 计算机视觉与模式识别

摘要

文本识别是文档数字化中一个长期存在的研究问题。现有方法通常基于CNN进行图像理解,基于RNN进行字符级文本生成。此外,通常还需要另一个语言模型作为后处理步骤来提高整体精度。在本文中,我们提出一种使用预训练图像Transformer和文本Transformer模型的端到端文本识别方法,即TrOCR,其利用Transformer架构进行图像理解和wordpiece级文本生成。TrOCR模型简单而有效,可使用大规模合成数据预训练并用人工标注数据集微调。实验表明,TrOCR模型在印刷体、手写体和场景文本识别任务上优于当前最先进的模型。TrOCR模型和代码公开于\url{https://aka.ms/trocr}。

关键词

引用

@article{arxiv.2109.10282,
  title  = {TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models},
  author = {Minghao Li and Tengchao Lv and Jingye Chen and Lei Cui and Yijuan Lu and Dinei Florencio and Cha Zhang and Zhoujun Li and Furu Wei},
  journal= {arXiv preprint arXiv:2109.10282},
  year   = {2022}
}

备注

Work in Progress