中文

通过共识驱动偏好优化缓解多语言 LLM 中的跨语言文化不一致性

计算与语言 2026-05-28 v2

摘要

尽管多语言大语言模型 (MLLM) 在各方面表现突出,但在 prompt 语言变化时常表现出不一致的行为。虽然这种适应通常是可取的,但当用户身份被明确定义时,这种现象就会成为严重问题。例如,给定固定的英国人角色和一条关于文学的模糊日常知识查询,prompt 的语言经常会覆盖系统角色——英文中出现莎士比亚,西班牙语中出现西班牙语的德西奥特斯。为稳健量化这种跨语言文化不一致性,我们引入 Singleton Fleiss's κS\kappa_S,这是一种对幻觉具有抗鲁棒性的度量标准。为缓解此问题,我们提出跨语言文化一致偏好优化 (C-3PO),一种基于共识驱动的对齐框架。C-3PO 在 κS\kappa_S 上比未对齐模型提升最高 0.13 分,始终优于强大的提示和表示引导基线,同时保持显式用户身份、文化中性和内在文化知识。实证评估表明,这种不一致性在印尼语和波斯语等较低资源语言中影响更大。最终,注意力解码中间层揭示,MLLM 在前向传递表示稳定时,会隐式地将输出个性化为针对 prompt 语言典型文化的倾向。

关键词

引用

@article{arxiv.2605.12515,
  title  = {Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation},
  author = {Lucas Resck and Isabelle Augenstein and Anna Korhonen},
  journal= {arXiv preprint arXiv:2605.12515},
  year   = {2026}
}

备注

24 pages, 13 figures, 11 tables