中文

推理还是修辞?对大型语言模型道德推理解释的实证分析

人工智能 2026-03-24 v1

摘要

大型语言模型是否进行道德推理,抑或仅仅是声称如此?我们调查了大型语言模型对道德困境的响应是否表现出通过科尔伯格道德发展阶段的真实发展过程,或者是否仅通过对齐训练产生类成熟道德判断的推理类输出,而缺乏 underlying developmental trajectory。我们使用经过验证的 LLM-as-judge 评分管道,对 13 个跨越不同架构、参数规模和训练 regime 的 LLM 的超过 600 项响应进行分类,并对六个经典道德困境进行十种互补分析,以刻画所得模式的性质和内部一致性。我们的结果显示,惊人的结果是:响应几乎全部对应于后约翰斯坦阶段(Stages 5-6),这与人类发展规律的有效逆向完全相同,其中 Stage 4 占主导。最令人惊讶的是,一部分模型表现出道德解耦:在表述的道德正当化与行动选择之间存在系统性不一致,这是一种逻辑不连贯形式,无论规模或提示策略均持续存在,代表了一种独立于修辞 sophistication 的直接推理一致性失败。模型规模带有统计上显著但实际意义不大的效应;训练类型对显著的独立主效应没有影响;模型表现出近乎机械的跨困境一致性,在语义上不同的道德问题中产生逻辑上不可区分的响应。我们认为,这些模式构成了道德假舌论的证据:通过对齐训练获得的,代表着成熟道德推理修辞惯例,而缺乏这些惯例所代表的 underlying developmental trajectory。

关键词

引用

@article{arxiv.2603.21854,
  title  = {Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models},
  author = {Aryan Kasat and Smriti Singh and Aman Chadha and Vinija Jain},
  journal= {arXiv preprint arXiv:2603.21854},
  year   = {2026}
}

备注

32 pages, 34 figures, 7 tables