中文

通过观看与总结提升半监督场景文字识别

计算机视觉与模式识别 2024-11-26 v1

摘要

现有的场景文字识别(STR)方法在识别具有挑战性的文字方面存在困难,尤其是艺术文字和严重畸变字符。其局限性在于未充分探索字符形态,包括广泛使用的合成训练数据的单调性以及模型对字符形态的敏感性。为此,我们受人类学习中观看与总结过程的启发,利用无人成本的合成和真实无标签数据,以对比学习方式推动 STR 框架自我驱动。首先,在观看过程中,为弥补合成数据简单性的不足并丰富字符形态多样性,我们提出一种在线生成策略,以生成无背景的样本并呈现多样字符风格。通过排除背景噪声干扰,模型被鼓励专注于字符形态,并在仅使用简单合成数据训练的情况下增强对复杂样本的识别能力。为提升总结过程,我们理论证明了先前字符对比损失的推导误差——该误差误认为导致类内分布稀疏,加剧了对挑战性样本的歧义。因此,提出一种新的 Character Unidirectional Alignment Loss 以纠正此误差,通过对齐学生模型中的字符特征与教师模型中的参考特征来统一所有样本中相同字符的表示。大量实验结果表明,我们的方法在常见基准测试和 Union14M-Benchmark 上的平均准确率分别达到 94.7% 和 70.9%,实现了 SOTA 水平。代码将在 https://github.com/qqqyd/ViSu 公开。

关键词

引用

@article{arxiv.2411.15585,
  title  = {Boosting Semi-Supervised Scene Text Recognition via Viewing and Summarizing},
  author = {Yadong Qu and Yuxin Wang and Bangbang Zhou and Zixiao Wang and Hongtao Xie and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2411.15585},
  year   = {2024}
}