中文

通过人格不一致实现大型语言模型的训练自由文化对齐

计算与语言 2026-05-19 v2 人工智能 计算机与社会

摘要

大型语言模型日益介入依赖于道德判断的决策,但越来越多的证据表明,它们的隐式偏好并非文化中性。现有的文化对齐方法要么需要每个国家的偏好数据和微调预算,要么假设对模型内部具有白盒访问,而商业API不可提供。本文聚焦于这个现实中的黑盒、仅限公共数据的 regime,观察到国内 sociodemographic 不一致而非共识是主要的驾驶信号。我们引入DISCA(基于不一致引导的文化对齐),一种推理时方法,将每个国家实例化为基于World-Values-Survey的人格代理器阵列,并将其不一致转换为受限的、稳健的logit校正。针对20个国家和7个开放权重主干网络(2B--70B),DISCA在MultiTP上减少了6个>=3.8B规模backbone的10--24%的文化误对齐,以及2--7%的开放式情景,无需更改任何权重。我们的结果表明,推理时校准是服务全球道德偏好的长尾的可扩展替代方案。

关键词

引用

@article{arxiv.2605.10843,
  title  = {Training-Free Cultural Alignment of Large Language Models via Persona Disagreement},
  author = {Huynh Trung Kiet and Dao Sy Duy Minh and Tuan Nguyen and Chi-Nguyen Tran and Phu-Hoa Pham and Nguyen Lam Phu Quy and The Anh Han and Long Tran-Thanh},
  journal= {arXiv preprint arXiv:2605.10843},
  year   = {2026}
}

备注

57 pages, 1 figure, 6 MultiTP moral dimensions