中文

超越选择题:面向阿拉伯语方言变体的开放式阿拉伯文化问答基准

计算与语言 2026-04-20 v2 人工智能

摘要

大型语言模型(LLM)日益用于回答日常问题,但在文化背景和方言内容上表现不一。我们提出了一套全面的方法:(i)将现代标准阿拉伯语(MSA)多选题(MCQ)翻译成英文及多个阿拉伯语方言;(ii)将其转化为开放式问题(OEQ);(iii)在MCQ与OEQ两种设置下,对一系列零样本和微调过的LLM进行基准测试;(iv)生成链式思维(CoT)理由以微调模型进行逐步推理。通过该方法,我们扩展了一个在多语言变体间实现平行对齐的现有数据集,堪称已知最早的此类数据集。我们对开放模型和封闭模型进行大量实验。结果表明:(i)模型在阿拉伯语方言上表现不佳,揭示了在文化背景和方言专属知识方面的持续差距;(ii)阿拉伯语专注模型在MCQ上表现良好,但在OEQ上挣扎;(iii)CoT虽提升了被判正确性,但在基于n-gram的指标上效果不一。该开发的数据集将公开发布,以支持进一步的文化和语言包容性评估研究。

关键词

引用

@article{arxiv.2510.24328,
  title  = {Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants},
  author = {Hunzalah Hassan Bhatti and Firoj Alam},
  journal= {arXiv preprint arXiv:2510.24328},
  year   = {2026}
}

备注

Cultural Knowledge, Everyday Knowledge, Open-Ended Question, Chain-of-Thought, Large Language Models, Native, Multilingual, Language Diversity