辨别关键因素:LLM 道德能力的多维评估
人工智能
2026-03-09 v4
摘要
道德能力是指按照道德原则行动的能力。随着大型语言模型(LLMs)越来越多地被部署在需要道德能力的场景中,对该能力进行实证评估的兴趣日益增长。我们综述了现有文献并识别出三个显著不足:(i)过度依赖预先包装的道德场景,其中道德特征被明确突出;(ii)侧重于判断预测而非道德推理;以及(iii)对模型识别何时需要额外信息的能力( inability )测试不足。基于道德技能哲学研究,我们随后引入了一种评估 LLM 道德能力的新方法。我们的方法超越了简单的判断比较,从五个维度评估道德能力:识别道德相关特征、权衡其重要性、为这些特征分配道德理由、综合连贯的道德判断以及识别信息缺口。我们进行了两项实验,将六种主流 LLM 与非专家人类和专业哲学家进行比较。在第一项使用现有工作标准道德情景的实验中,LLMs 在多个道德推理维度上总体优于非专家人类。然而,第二项实验采用嵌入相关特征于无关细节中的新颖场景以测试道德敏感性,揭示了一个显著的逆转:若干 LLMs 的表现显著低于人类。我们的发现表明,当前评估可能通过消除从噪声信息中辨别道德相关性的任务而大幅高估了 LLM 的道德推理能力,而我们认为这一任务是真正道德技能的先决条件。本工作为评估 AI 道德能力提供了更细致的框架,并指出了提升先进 AI 系统道德能力的重要方向。
引用
@article{arxiv.2506.13082,
title = {Discerning What Matters: A Multi-Dimensional Assessment of Moral Competence in LLMs},
author = {Daniel Kilov and Caroline Hendy and Secil Yanik Guyot and Aaron J. Snoswell and Seth Lazar},
journal= {arXiv preprint arXiv:2506.13082},
year = {2026}
}