从 FusHa 到 Folk:探索阿拉伯语言模型中的跨语言迁移
计算与语言
2026-04-01 v2
摘要
阿拉伯语言模型(Arabic Language Models,LMs)主要在现代标准阿拉伯语(Modern Standard Arabic,MSA)上预训练,期望其能迁移到该方言。虽然MSA作为标准书面变体在正式场合中常见,但人们在各种方言中进行交谈和书面交流,这些方言在阿拉伯地区分布广泛。这会给阿拉伯语言模型带来限制,因为这些方言与MSA的相似性各不相同。本文我们研究了使用在3种自然语言处理(Natural Language Processing,NLP)任务上的探测和表征相似性来研究阿拉伯模型的跨语言迁移。我们的结果表明,迁移是可能的,但在不同方言之间的迁移程度不均衡,我们发现这部分是由其地理接近性所解释的。此外,我们发现训练支持所有阿拉伯方言的模型时会出现负向干扰,这质疑了这些方言的相似程度,并对阿拉伯模型中的跨语言迁移提出了关切。
引用
@article{arxiv.2602.09826,
title = {From FusHa to Folk: Exploring Cross-Lingual Transfer in Arabic Language Models},
author = {Abdulmuizz Khalak and Abderrahmane Issam and Gerasimos Spanakis},
journal= {arXiv preprint arXiv:2602.09826},
year = {2026}
}
备注
Accepted to VarDial 2026