中文

解耦语言与文化以评估多语言大语言模型

计算与语言 2025-06-02 v1

摘要

本文引入了一个双重评估框架,以全面评估 LLM 的多语言能力。通过沿语言媒介和文化语境维度分解评估,该框架能够对 LLM 在跨语言的本土和跨文化语境下处理问题的能力进行细致分析。我们在广泛的模型上进行了大量评估,揭示了一个显著的“文化-语言协同”现象,即当问题在文化上与语言相匹配时,模型表现出更好的性能。我们通过可解释性探针进一步探索了这一现象,这表明在语言的文化语境中,特定神经元被激活的比例更高。这种激活比例可作为模型训练期间评估多语言性能的潜在指标。我们的发现挑战了主要基于英语数据训练的 LLM 在各语言上表现一致的普遍观点,并突出了进行文化和语言层面模型评估的必要性。我们的代码可在 https://yingjiahao14. github.io/Dual-Evaluation/ 找到。

关键词

引用

@article{arxiv.2505.24635,
  title  = {Disentangling Language and Culture for Evaluating Multilingual Large Language Models},
  author = {Jiahao Ying and Wei Tang and Yiran Zhao and Yixin Cao and Yu Rong and Wenxuan Zhang},
  journal= {arXiv preprint arXiv:2505.24635},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main Conference)