中文

手写文字识别模型的泛化性

机器学习 2025-06-03 v2

摘要

近期的手写文字识别(HTR)技术进展显著降低了在标准基准测试上的转录错误率,这些基准测试在独立同分布(i.i.d.)假设下进行,从而侧重于最小化分布内(ID)错误。然而,这一假设在实际应用中不成立,这促使HTR研究探索迁移学习和域适应技术。本文研究了HTR模型在泛化到分布外(OOD)数据方面的未被充分解决的局限性。我们采用域泛化的具有挑战性的设置,即模型需在无任何先验访问的情况下泛化到OOD数据。为此,我们分析了来自八个最先进HTR模型的336个OOD案例,涵盖七个常用数据集,跨越五种语言。此外,我们研究了HTR模型如何利用合成数据进行泛化。我们发现,文本在域之间之间的差异是泛化最重要的因素,其次是视觉差异。我们表明,HTR模型在OOD场景中的错误可以可靠地估计, discrepancy 在70%的情况下小于10分。我们识别了HTR模型的根本性限制,为未来研究提供了解决这一挑战的基础。

关键词

引用

@article{arxiv.2411.17332,
  title  = {On the Generalization of Handwritten Text Recognition Models},
  author = {Carlos Garrido-Munoz and Jorge Calvo-Zaragoza},
  journal= {arXiv preprint arXiv:2411.17332},
  year   = {2025}
}