重新审视场景文本识别:数据视角
计算机视觉与模式识别
2023-07-20 v2
摘要
本文旨在从数据导向的视角重新评估场景文本识别(STR)。我们首先 revisit STR 中六个常用基准,观察到性能饱和趋势:由 13 个代表性模型集成仅 2.91% 的基准图像无法被准确识别。尽管这些结果令人印象深刻并暗示 STR 可被视为已解决,但我们认为这主要源于常用基准挑战性不足,从而掩盖了 STR 面临的潜在问题。为此,我们整合了一个大规模真实 STR 数据集,即 Union14M,包含 400 万张标注图像和 1000 万张未标注图像,以评估 STR 模型在更复杂真实场景中的性能。我们的实验表明,13 个模型在 400 万标注图像上仅能达到 66.53% 的平均准确率,说明 STR 在真实世界中仍面临众多挑战。通过分析 13 个模型的错误模式,我们识别出 STR 中七个开放性挑战,并构建了由八个不同子集组成的挑战驱动基准以促进该领域进一步进展。我们的探索表明 STR 远未解决,而利用数据或是一种有前景的方案。就此,我们发现通过自监督预训练利用 1000 万未标注图像,可显著提升 STR 模型在真实场景中的鲁棒性,并取得最先进(SOTA)性能。
引用
@article{arxiv.2307.08723,
title = {Revisiting Scene Text Recognition: A Data Perspective},
author = {Qing Jiang and Jiapeng Wang and Dezhi Peng and Chongyu Liu and Lianwen Jin},
journal= {arXiv preprint arXiv:2307.08723},
year = {2023}
}
备注
Accepted to ICCV2023