中文

伦理阶梯:通过多步骤归纳推理复杂道德困境以探测 LLM 的价值优先级

计算与语言 2025-05-26 v1 计算机与社会

摘要

伦理决策是人类判断的关键方面,随着 LLM 在决策支持系统中的应用增长,对其道德推理能力的严格评估变得至关重要。然而,现有的评估主要依赖单步骤测试,无法捕捉模型如何应对不断演化的伦理挑战。为此,我们引入了多步骤道德困境(MMDs),这是第一个专为评估 LLM 在 3,302 个五阶段困境中演变的道德判断而构建的数据集。该框架实现了对 LLM 在升级式困境中道德推理变化的细粒度、动态分析。我们对九个主流 LLM 进行评估,发现随着困境的推进,这些模型的价值偏好会发生显著变化,表明模型会根据场景复杂度对道德判断进行校准。此外,两两比较显示,尽管 LLM 常常优先考虑关怀价值,但在某些情境下,这一价值可能被公平取代,凸显了 LLM 伦理推理的动态性和情境依赖性。我们的发现呼吁转向动态、情境感知的评估范式,为开发更贴近人类且价值敏感的 LLM 铺平了道路。

关键词

引用

@article{arxiv.2505.18154,
  title  = {The Staircase of Ethics: Probing LLM Value Priorities through Multi-Step Induction to Complex Moral Dilemmas},
  author = {Ya Wu and Qiang Sheng and Danding Wang and Guang Yang and Yifan Sun and Zhengjia Wang and Yuyan Bu and Juan Cao},
  journal= {arXiv preprint arXiv:2505.18154},
  year   = {2025}
}

备注

25 pages, 8 figures