中文

MCEval:面向多语言文化公平性评估的动态 LLM 框架

计算与语言 2025-07-15 v1

摘要

大型语言模型(LLM)表现出文化偏见且在跨文化理解能力有限,尤其当服务于具有不同文化背景的全球用户群体时。我们提出MCEval,一种新型多语言评估框架,采用动态文化问题构建方法,并通过反事实重述(Counterfactual Rephrasing)和混杂变量重述(Confounder Rephrasing)实现因果分析。该框架覆盖13种文化和13种语言,系统评估不同语言情境下的文化意识与文化偏见。框架提供39,897个文化意识实例和17,940个文化偏见实例。实验结果揭示了不同语言情境间的性能差异,表明最佳文化绩效不仅与训练数据分布相关,也与语言-文化对齐程度有关。评估结果还暴露了公平性问题,即在英文情境中看似成功的方法在其他情境中会造成显著劣势。MCEval代表了首个全面多语言文化评估框架,为深入洞察LLM的文化理解提供了洞见。

关键词

引用

@article{arxiv.2507.09701,
  title  = {MCEval: A Dynamic Framework for Fair Multilingual Cultural Evaluation of LLMs},
  author = {Shulin Huang and Linyi Yang and Yue Zhang},
  journal= {arXiv preprint arXiv:2507.09701},
  year   = {2025}
}