TrOCR:基于Transformer与预训练模型的 Optical Character Recognition
计算与语言
2022-09-07 v5 计算机视觉与模式识别
摘要
文本识别是文档数字化中一个长期存在的研究问题。现有方法通常基于CNN进行图像理解,基于RNN进行字符级文本生成。此外,通常还需要另一个语言模型作为后处理步骤来提高整体精度。在本文中,我们提出一种使用预训练图像Transformer和文本Transformer模型的端到端文本识别方法,即TrOCR,其利用Transformer架构进行图像理解和wordpiece级文本生成。TrOCR模型简单而有效,可使用大规模合成数据预训练并用人工标注数据集微调。实验表明,TrOCR模型在印刷体、手写体和场景文本识别任务上优于当前最先进的模型。TrOCR模型和代码公开于\url{https://aka.ms/trocr}。
引用
@article{arxiv.2109.10282,
title = {TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models},
author = {Minghao Li and Tengchao Lv and Jingye Chen and Lei Cui and Yijuan Lu and Dinei Florencio and Cha Zhang and Zhoujun Li and Furu Wei},
journal= {arXiv preprint arXiv:2109.10282},
year = {2022}
}
备注
Work in Progress