中文

低资源手写体识别中跨语言迁移提升机制:序列建模的作用

计算机视觉与模式识别 2026-05-08 v1

摘要

针对阿拉伯文字语言的手写体识别(HTR)在低资源条件下,特别是采用结合卷积编码器与序列建模的 CRNN 模型进行跨语言联合训练时,能够实现显著的跨语言收益。然而,究竟是共享视觉表征还是序列层面的依赖更能解释这些改进,尚不明确。在本研究中,我们对 line-level 阿拉伯文字 HTR 进行了受控的架构研究,将 CNN-only 模型与 CTC 解码相比较,同时在相同的单脚本和多脚本训练方案下进行对比实验。实验在阿拉伯语(KHATT)、乌尔都语(NUST-UHWR)和波斯语(PHTD)数据集上进行,低资源设置为 K in {100, 500, 1000}。我们的结果显示出清晰的转移行为差异:虽然 CNN-only 模型仅显示有限或不稳定的改进,CRNN 模型在多脚本训练下实现更好的性能,尤其在最数据受限的情境下表现更佳。聚焦于转移改进(delta CER)而非绝对性能,我们发现跨语言改进与序列级建模相关,而仅通过 CNN 编码器学习的共享视觉表征(对应于字符在不同脚本之间的相似性)似乎不足以实现有效的迁移。这一发现表明,在低资源情境下,上下文建模在促进有效迁移方面发挥重要作用,类似的行为可能也适用于其他低资源语言设置。

关键词

引用

@article{arxiv.2605.05900,
  title  = {Understanding Cross-Language Transfer Improvements in Low-Resource HTR: The Role of Sequence Modeling},
  author = {Sana Al-azzawi and Chang Liu and Nudrat Habib and Elisa Barney and Marcus Liwicki},
  journal= {arXiv preprint arXiv:2605.05900},
  year   = {2026}
}