中文

TEACH:将文本编码作为场景文本识别的课程提示

计算机视觉与模式识别 2025-08-05 v1

摘要

场景文本识别(STR)因复杂的视觉外观和有限的语义先验而具有挑战性。我们提出TEACH,一种新颖的训练范式,将ground-truth文本注入模型作为辅助输入,并在训练过程中逐渐减少其影响。在编码目标标签到嵌入空间并应用损失感知掩码的基础上,TEACH模拟了从标签依赖学习到完全视觉识别的课程学习过程。不同于语言模型方法,TEACH无需外部预训练,亦无推理开销。它具有模型中立性,可无缝集成到现有的编码器-解码器框架中。广泛实验表明,使用TEACH训练的模型在多个公开基准上实现持续的准确率提升,尤其在面对挑战性条件时表现尤为突出,验证了其鲁棒性和广泛适用性。

关键词

引用

@article{arxiv.2508.01153,
  title  = {TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition},
  author = {Xiahan Yang and Hui Zheng},
  journal= {arXiv preprint arXiv:2508.01153},
  year   = {2025}
}

备注

9 pages (w/o ref), 5 figures, 7 tables