阿拉伯方言对话中 LLM 的文化基准化
计算与语言
2026-05-04 v1 人工智能
摘要
在使用捕获文化丰富且包含方言语境的对话数据集评估 LLM 的文化推理能力时存在显著差距。大多数阿拉伯基准测试聚焦于现代标准阿拉伯语(MSA)中的短文本片段,忽略在对话中自然出现的文化细微差别。为弥合这一差距,我们引入 ArabCulture-Dialogue,一个覆盖 13 个阿拉伯语国家、涵盖 MSA 与各国本土方言的、基于日常生活主题(共 12 大类、54 小类)的文化对话数据集。我们利用该数据集构建了三个基准任务:(i)多选文化推理,(ii)MSA 与方言之间的机器翻译,(iii)方言引导生成。我们的实验表明,MSA 与阿拉伯方言之间的性能差距仍然存在,即模型在方言情境下的三个任务性能均低于 MSA 情境。
引用
@article{arxiv.2605.00119,
title = {Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues},
author = {Muhammad Dehan Al Kautsar and Saeed Almheiri and Momina Ahsan and Bilal Elbouardi and Younes Samih and Sarfraz Ahmad and Amr Keleg and Omar El Herraoui and Kareem Elzeky and Abed Alhakim Freihat and Mohamed Anwar and Zhuohan Xie and Junhong Liang and Mohammad Rustom Al Nasar and Preslav Nakov and Fajri Koto},
journal= {arXiv preprint arXiv:2605.00119},
year = {2026}
}
备注
23 pages, 7 figures, 16 tables