正字法一致性对阿拉伯文字语言文本分类多语言嵌入模型的作用
计算与语言
2025-07-28 v1
摘要
在自然语言处理中,像mBERT和XLM-RoBERTa这样的多语言模型承诺了广泛的覆盖范围,但常常在处理共享同一文字但正字法规范和文化背景不同的语言时遇到困难。这个问题在阿拉伯文字语言中尤为显著,例如库尔德语索拉尼方言、阿拉伯语、波斯语和乌尔都语。我们引入了阿拉伯文字RoBERTa(AS-RoBERTa)系列:四个基于RoBERTa的模型,每个模型都在针对其特定语言定制的大型语料库上进行了预训练。通过将预训练聚焦于特定语言的文字特征和统计信息,我们的模型捕捉到了通用模型忽略的模式。当针对分类任务进行微调时,AS-RoBERTa变体比mBERT和XLM-RoBERTa高出2到5个百分点。一项消融研究证实,聚焦于文字的预训练是这些性能提升的核心。使用混淆矩阵进行的错误分析显示了共享的文字特征和领域特定内容如何影响性能。我们的结果凸显了针对使用阿拉伯文字的语言进行文字感知专门化的价值,并支持在基于文字和语言特异性的预训练策略方面开展进一步工作。
引用
@article{arxiv.2507.18762,
title = {The Role of Orthographic Consistency in Multilingual Embedding Models for Text Classification in Arabic-Script Languages},
author = {Abdulhady Abas Abdullah and Amir H. Gandomi and Tarik A Rashid and Seyedali Mirjalili and Laith Abualigah and Milena Živković and Hadi Veisi},
journal= {arXiv preprint arXiv:2507.18762},
year = {2025}
}