CulturALL: 衡量大语言模型在具体任务上的多语言和多文化能力的基准
计算与语言
2026-04-22 v1 人工智能
摘要
大型语言模型(LLM)已在全球范围内部署, 推动了衡量其多语言和多文化能力的基准测试的激增。然而, 这些基准测试侧重于通用语言理解或浅层文化琳琅, 留下了对具体任务中LLM能力的评估 largely unaddressed。为填补这一空白, 我们提出了CulturALL, 一个全面且具有挑战性的基准, 用于评估LLM在具体任务上的多语言和多文化能力。CulturALL通过人工智能协作框架构建: 专家注释员确保适当的难度和事实准确性, 而LLM减轻了手动工作负担。通过融合多样化来源, CulturALL确保了全面的情景覆盖。每个项目都经过精心设计, 以提供较高的难度水平, 使CulturALL具有挑战性。CulturALL包含2610个样本, 覆盖14种语言, 来自51个地区, 分布在16个主题以覆盖具体任务的全部范围。实验表明, 最佳LLM在CulturALL上的准确率仅为44.48%, 这凸显了仍有很大的提升空间。
引用
@article{arxiv.2604.19262,
title = {CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks},
author = {Peiqin Lin and Chenyang Lyu and Wenjiang Luo and Haotian Ye and Md Mehrab Hossain and Chunlan Ma and Shaoxiong Ji and Younes Samih and Bo Zeng and Fan Jiang and Yuanbin Cao and Dilda Duisenbek and Adrian Neo Sau Xun and Daria Pozdniakova and Liubou Misevich and Nevena Marinković and Ngoc Gia Linh Nguyen and Thi Khanh Linh Do and Sarakmatak Sophy and Baotian Hu and Guanhua Chen and Gongbo Tang and Alham Fikri Aji and Longyue Wang and Weihua Luo},
journal= {arXiv preprint arXiv:2604.19262},
year = {2026}
}