中文

OCR缩放定律的实证研究

计算机视觉与模式识别 2024-02-01 v3

摘要

模型大小、数据量、计算量与模型性能之间的规律在自然语言处理(NLP)领域已被广泛研究。然而,光学字符识别(OCR)中的缩放定律尚未被研究。为了解决这个问题,我们进行了全面的研究,考察了文本识别领域中性能与模型规模、数据量和计算量之间的相关性。结论是,当其他影响因素保持不变时,性能与模型大小以及训练数据量之间存在平滑的幂律关系。此外,我们构建了一个名为REBU-Syn的大规模数据集,包含600万真实样本和1800万合成样本。基于我们的缩放定律和新数据集,我们成功训练了一个场景文本识别模型,在6个常见测试基准上取得了新的最先进结果,top-1平均准确率为97.42%。模型和数据集公开在https://github.com/large-ocr-model/large-ocr-model.github.io。

关键词

引用

@article{arxiv.2401.00028,
  title  = {An Empirical Study of Scaling Law for OCR},
  author = {Miao Rang and Zhenni Bi and Chuanjian Liu and Yunhe Wang and Kai Han},
  journal= {arXiv preprint arXiv:2401.00028},
  year   = {2024}
}