中文

重新思考不规则场景文本识别

计算机视觉与模式识别 2019-11-12 v2 机器学习 图像与视频处理

摘要

由于文本字体、颜色、大小、复杂背景等的极大多样性,从自然图像中读取文本具有挑战性。字符的透视畸变和非线性空间排布使其更加困难。虽然基于矫正的方法在直觉上有依据,并且迄今为止推动了性能边界,但其潜力远未被充分利用。本文提出一组技巧,证明能显著提升基于矫正方法的性能。在弯曲文本数据集上,我们的方法在 CUTE-80 上达到 89.6% 的准确率,在 Total-Text 上达到 76.3%,分别比先前 SOTA 提升 6.3% 和 14.7%。此外,我们的技巧组合帮助我们赢得了 ICDAR 2019 任意形状文本挑战赛(拉丁文字),在留出测试集上达到 74.3% 的准确率。我们在 https://github.com/Jyouhou/ICDAR2019-ArT-Recognition-Alchemy 发布了代码和数据样本以供进一步探索。

关键词

引用

@article{arxiv.1908.11834,
  title  = {Rethinking Irregular Scene Text Recognition},
  author = {Shangbang Long and Yushuo Guan and Bingxuan Wang and Kaigui Bian and Cong Yao},
  journal= {arXiv preprint arXiv:1908.11834},
  year   = {2019}
}

备注

Technical report for participation in ICDAR2019-ArT recognition track