阿拉伯文字低资源手写识别中的跨语言学习
计算机视觉与模式识别
2026-05-05 v1
摘要
在有限标注数据条件下的手写文字识别(HTR)仍然是一个具有挑战性的问题,尤其是针对阿拉伯文字语言。尽管现代基于序列的识别器在高资源环境中表现良好,但随着训练数据的稀缺,其准确率会显著下降。阿拉伯文字语言共享相同的书写系统并具有大量字符重叠,这激励了跨脚本训练作为缓解数据稀缺的策略。我们对阿拉伯、乌尔都利和波斯文本素进行了实验,在低资源环境下实现了超越单脚本基线的改进(尤其是低资源环境)。我们实验的关键发现是,跨脚本传递主要由脚本层面的重叠驱动,而非均匀的准确率提升。通过统计的字符层面分析,我们展示 gains 在跨脚本共享的字符上结构性地集中,而语言特定字符则表现出有限或负面的传递。这些发现为低资源脚本族中的传递动态提供了洞见。详细结果包括:我们对阿拉伯脚本 HTR 在低资源条件下进行受控的行级跨脚本联合训练研究(样本数 K \in 100, 500, 1000 标注行),分别使用阿拉伯(KHATT)、乌尔都利(NUST-UHWR)和波斯(PHTD)数据集。对 CRNN 模型在多个相关阿拉伯脚本数据集的联合训练,并在单个目标语言上进行评估。在波斯(PHTD)数据集上,联合训练实现了 9.99 的字符错误率(CER),超越了之前报告的结果,尽管未使用全部可用训练数据。在乌尔都利数据集(UNHD)上,联合训练将 CER 从 17.20 降至 14.45。我们发布代码和数据划分,以确保可重复性。
引用
@article{arxiv.2605.02089,
title = {Cross-Language Learning within Arabic Script for Low-Resource HTR},
author = {Sana Al-azzawi and Elisa Barney and Marcus Liwicki},
journal= {arXiv preprint arXiv:2605.02089},
year = {2026}
}