XCR-Bench:评估大语言模型文化推理能力的多任务基准
计算与语言
2026-01-21 v1 人工智能
计算机与社会
摘要
大语言模型(LLM)的跨文化能力需要能够识别文化特定项(CSI),并能在不同文化语境中恰当地调整它们。评估这一能力的进展一直受到缺乏高质量、带有平行跨文化句子对的CSI标注语料库的限制。为解决这一局限,我们引入了XCR-Bench,一个跨文化推理基准,包含4.9k个平行句子和1,098个独特的CSI,涵盖三个不同的推理任务及相应的评估指标。我们的语料库将Newmark的CSI框架与Hall的文化三层次理论相结合,能够系统分析超越表面人工制品的文化推理,深入到半可见和不可见的文化元素,如社会规范、信仰和价值观。我们的研究结果表明,最先进的大语言模型在识别和调整与社会礼仪和文化指涉相关的CSI方面表现出持续的弱点。此外,我们发现有证据表明,即使在单一语言环境中进行文化适应时,大语言模型也会编码区域性和民族-宗教偏见。我们发布我们的语料库和代码,以促进未来跨文化自然语言处理(NLP)的研究。
引用
@article{arxiv.2601.14063,
title = {XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs},
author = {Mohsinul Kabir and Tasnim Ahmed and Md Mezbaur Rahman and Shaoxiong Ji and Hassan Alhuzali and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2601.14063},
year = {2026}
}
备注
30 Pages, 13 Figures