中文

多语言 != 多文化:评估大语言模型中多语言能力与文化对齐之间的差距

计算与语言 2025-09-03 v2 人工智能 计算机与社会

摘要

大型语言模型 (LLM) 正变得越来越在全球语言方面具有能力。然而,跨语言的交流能力并不一定等同于适当的文化表征。一个关键担忧是 US 中心偏见,即 LLM 反映 US 而非当地文化价值观。我们提出了一种新方法,通过将 LLM 生成的响应分布与来自世界价值调查的 population-level opinion 数据进行比较,覆盖四种语言(丹麦语、荷兰语、英语和葡萄牙语)。使用严格的线性混合效应回归框架,我们比较了两类模型:Google 的 Gemma 模型(2B--27B 参数)和 OpenAI 的 turbo 系列模型。对于这两类模型,我们发现语言能力与文化对齐之间不存在一致关系。虽然 Gemma 模型在各种语言中呈现出语言能力与文化对齐的正相关,但 OpenAI 模型则不然。重要的是,我们发现自洽性是多文化对齐的更强预测器,而非多语言能力。我们的结果表明,要实现有意义的文化对齐,需要专门的努力,而不仅仅是提高通用语言能力。

关键词

引用

@article{arxiv.2502.16534,
  title  = {Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs},
  author = {Jonathan Rystrøm and Hannah Rose Kirk and Scott Hale},
  journal= {arXiv preprint arXiv:2502.16534},
  year   = {2025}
}

备注

Accepted at OMMM@RANLP2025