阿拉伯语NLP的三大愿望:保真度、双语与多方言生成
计算与语言
2026-02-19 v1
摘要
阿拉伯方言在自然语言处理 (NLP) 研究中长期缺乏代表性,这源于其非标准化和高度变异性,给计算建模带来了挑战。近期的进展,如大型语言模型 (LLM),为弥合这一差距提供了有前景的途径,通过将阿拉伯语建模为一种而非单一的多中心语言。本文介绍了Aladdin-FTI,我们提交给AMIYA共享任务。该系统设计用于生成和翻译方言阿拉伯语 (DA)。具体而言,模型支持生成摩洛哱、埃及、巴勒斯坦、叙利亚和沙特方言的文本,以及在这些方言、现代标准阿拉伯语 (MSA) 和英语之间的双向翻译。代码和训练好的模型已公开提供。
引用
@article{arxiv.2602.16290,
title = {Aladdin-FTI @ AMIYA Three Wishes for Arabic NLP: Fidelity, Diglossia, and Multidialectal Generation},
author = {Jonathan Mutal and Perla Al Almaoui and Simon Hengchen and Pierrette Bouillon},
journal= {arXiv preprint arXiv:2602.16290},
year = {2026}
}
备注
13 pages, Paper submitted to the AMIYA shared task at the VarDial workshop, co-located with EACL 2026