中文

语言模型是后果主义还是义务论道德推理者?

计算与语言 2025-10-14 v2

摘要

随着AI系统越来越多地应用于医疗、法律和治理领域,理解它们如何处理伦理复杂场景变得至关重要。先前的工作主要考察大语言模型(LLM)中的道德判断,而非其底层的道德推理过程。相比之下,我们专注于对LLM提供的道德推理轨迹进行大规模分析。此外,与先前试图仅从少数道德困境中推断结论的工作不同,我们的研究利用超过600个不同的电车难题作为探针,以揭示不同LLM中出现的推理模式。我们引入并测试了一种道德理由分类法,根据两种主要的规范伦理学理论:后果主义和义务论,系统地分类推理轨迹。我们的分析表明,LLM的思维链倾向于偏向基于道德义务的义务论原则,而事后解释则明显转向强调效用的后果主义理由。我们的框架为理解LLM如何处理和表达伦理考量提供了基础,这是朝着在高风险决策环境中安全且可解释地部署LLM迈出的重要一步。我们的代码可在 https://github.com/keenansamway/moral-lens 获取。

关键词

引用

@article{arxiv.2505.21479,
  title  = {Are Language Models Consequentialist or Deontological Moral Reasoners?},
  author = {Keenan Samway and Max Kleiman-Weiner and David Guzman Piedrahita and Rada Mihalcea and Bernhard Schölkopf and Zhijing Jin},
  journal= {arXiv preprint arXiv:2505.21479},
  year   = {2025}
}

备注

EMNLP 2025