提升非拉丁文场景文本识别的准确率
计算机视觉与模式识别
2022-01-11 v1
摘要
由于多种字体、简化的词汇统计、更新的数据生成工具以及书写系统等因素,拉丁语系场景文本识别的准确率显著优于非拉丁语系。本文通过比较英文数据集与非拉丁语言,考察了低准确率的可能原因。我们比较了词图像尺寸(宽与高)及词长度统计等多种特征。过去十年中,利用强大深度学习技术生成合成数据集极大提升了场景文本识别。我们在英文上通过改变(i)用于创建合成数据的字体数与(ii)所创建词图像数进行了若干受控实验。我们发现这些因素对场景文本识别系统至关重要。英文合成数据集使用了超过 1400 种字体,而阿拉伯语及其他非拉丁数据集用于数据生成的字体不足 100 种。由于其中部分语言分属不同地区,我们通过基于地区的检索获取额外字体以改进阿拉伯语与天城文的场景文本识别模型。相较于先前工作 or 基线,我们在阿拉伯语 MLT-17 与 MLT-19 数据集上的词识别率(WRR)分别提升 24.54% 与 2.32%。我们在 IIIT-ILST 与 MLT-19 天城文数据集上取得 7.88% 与 3.72% 的 WRR 增益。
引用
@article{arxiv.2201.03185,
title = {Towards Boosting the Accuracy of Non-Latin Scene Text Recognition},
author = {Sanjana Gunna and Rohit Saluja and C. V. Jawahar},
journal= {arXiv preprint arXiv:2201.03185},
year = {2022}
}
备注
12 pages, 6 figures