AL-QASIDA:系统分析大语言模型在阿拉伯语方言中的质量与准确性
计算与语言
2025-01-07 v2
摘要
阿拉伯语方言(DA)变体在语言技术,尤其是大语言模型(LLMs)方面服务不足。这一趋势可能加剧现有的社会不平等并限制大语言模型的应用,然而研究界缺乏对阿拉伯语方言性能的可操作化测量。我们提出了一个框架,从四个维度全面评估大语言模型的阿拉伯语方言建模能力:忠实度、理解力、质量和双言现象。我们评估了九种大语言模型在八种阿拉伯语方言变体上的表现,并提供了实用建议。我们的评估表明,大语言模型生成阿拉伯语方言的能力不如其理解能力,原因并非其方言流利度差,而是它们不愿生成方言。进一步分析表明,当前的后训练可能助长了对阿拉伯语方言的偏见,而少样本示例可以克服这一缺陷,除此之外,输入文本的可测量特征与大语言模型的阿拉伯语方言性能之间没有良好的相关性。
引用
@article{arxiv.2412.04193,
title = {AL-QASIDA: Analyzing LLM Quality and Accuracy Systematically in Dialectal Arabic},
author = {Nathaniel R. Robinson and Shahd Abdelmoneim and Kelly Marchisio and Sebastian Ruder},
journal= {arXiv preprint arXiv:2412.04193},
year = {2025}
}
备注
Pre-print