重新思考不规则场景文本识别
计算机视觉与模式识别
2019-11-12 v2 机器学习
图像与视频处理
摘要
由于文本字体、颜色、大小、复杂背景等的极大多样性,从自然图像中读取文本具有挑战性。字符的透视畸变和非线性空间排布使其更加困难。虽然基于矫正的方法在直觉上有依据,并且迄今为止推动了性能边界,但其潜力远未被充分利用。本文提出一组技巧,证明能显著提升基于矫正方法的性能。在弯曲文本数据集上,我们的方法在 CUTE-80 上达到 89.6% 的准确率,在 Total-Text 上达到 76.3%,分别比先前 SOTA 提升 6.3% 和 14.7%。此外,我们的技巧组合帮助我们赢得了 ICDAR 2019 任意形状文本挑战赛(拉丁文字),在留出测试集上达到 74.3% 的准确率。我们在 https://github.com/Jyouhou/ICDAR2019-ArT-Recognition-Alchemy 发布了代码和数据样本以供进一步探索。
引用
@article{arxiv.1908.11834,
title = {Rethinking Irregular Scene Text Recognition},
author = {Shangbang Long and Yushuo Guan and Bingxuan Wang and Kaigui Bian and Cong Yao},
journal= {arXiv preprint arXiv:1908.11834},
year = {2019}
}
备注
Technical report for participation in ICDAR2019-ArT recognition track