中文

多语言捕手车问题中的语言模型对齐

计算与语言 2025-05-29 v6

摘要

我们评估了LLM在多语言捕手车问题中的道德对齐程度。基于捕手车实验(该实验跨越200多个国家,收集了超过4000万条人类判断),我们构建了一个跨语言道德困境语料库MultiTP,包含100多种语言的道德情景文本。该数据集使我们能够评估LLM在不同语言语境下的决策过程。我们的分析探讨了19种不同LLM与人类判断之间的对齐情况,捕捉了跨六个道德维度(物种、性别、体能、社会地位、年龄以及涉及的生命数量)的偏好。通过将这些偏好与语言使用者的民族分布相关联,并检查LLM对各种提示 paraphrasing 响应的一致性,我们的发现为理解LLM的跨语言伦理偏见及其交叉提供了洞见。我们发现不同语言之间的对齐程度存在显著差异,这挑战了AI系统在道德推理中均匀性的假设,强调在AI伦理中纳入多元视角的重要性。结果凸显了在负责任AI研究中整合多语言维度的必要性,以确保全球AI互动的公平与公正。我们的代码和数据已公开于 https://github.com/causalNLP/moralmachine。

关键词

引用

@article{arxiv.2407.02273,
  title  = {Language Model Alignment in Multilingual Trolley Problems},
  author = {Zhijing Jin and Max Kleiman-Weiner and Giorgio Piatti and Sydney Levine and Jiarui Liu and Fernando Gonzalez and Francesco Ortu and András Strausz and Mrinmaya Sachan and Rada Mihalcea and Yejin Choi and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2407.02273},
  year   = {2025}
}

备注

ICLR 2025 Spotlight, Best Paper @ NeurIPS 2024 Workshop on Pluralistic Alignment