思维模式如何改变 LLM 的道德判断?跨五种前沿模型的即时与思维受控对比研究
人工智能
2026-05-07 v1
摘要
我们评估在同一模型检查点内,启用提供商暴露的推理模式是否会改变道德判断。在 100 个道德判断场景和五个前沿推理训练的 LLM(Claude Sonnet 4.6、GPT 5.5、Gemini 3 Flash、DeepSeek V3.1 和 Qwen3.5 397B)中,即时模式与思维模式之间的总体二元判决一致性保持较高水平,且在统计上无法区分(Krippendorff's alpha = 0.78 vs. 0.79)。然而,分歧集中在 21 个模型存在争议的场景中,在这些场景中,即时模式的一致性接近随机水平(alpha = 0.08)。在这些场景上,推理定向缩小了跨模型分歧,将 10 分制下的平均成对一致性从 5.4 提高至 6.7。推理还降低了五个模型中三个模型的人口统计学判断不一致性,且未增加任何模型的不一致性。在所有五个模型系列中,推理改变自标定伦理框架的频率高于改变二元判决的频率。
引用
@article{arxiv.2605.04488,
title = {How Does Thinking Mode Change LLM Moral Judgments? A Controlled Instant-vs-Thinking Comparison Across Five Frontier Models},
author = {Sai Sourabh Madur},
journal= {arXiv preprint arXiv:2605.04488},
year = {2026}
}