大语言模型道德判断的脆弱性
摘要
人们越来越多地使用大语言模型(LLM)用于日常道德和人际关系指导,然而这些系统无法质询缺失的背景并对 dilemmas 进行判断。我们引入一个扰动框架,用于测试保持基本道德冲突不变的情况下,LLM 道德判断的稳定性和可操控性。使用来自 r/AmItheAsshole(2025 年 1 月至 3 月)的 2,939 个 dilemmas,我们生成三类内容扰动:1)surface edits(词汇/结构噪声);2)point-of-view shifts(视角和立场中和);3)persuasion cues(自我定位、社会证明、pattern admissions、受害者框架)。我们也变化评估协议(输出排序、指令放置和非结构化提示)。我们使用四个模型(GPT-4.1、Claude 3.7 Sonnet、DeepSeek V3、Qwen2.5-72B)(N=129,156 judgments)对所有变体进行评估。surface 扰动产生较低的翻转率(7.5%),基本处于自我一致性噪声水平(4-13%)之内,而 point-of-view shifts 则导致显著更高的不稳定性(24.3%)。大量 dilemmas(37.9%)对 surface 噪声具有鲁棒性,却在视角变化下翻转,表明模型对叙事语音作为实用性线索进行条件化。不稳定性集中在道德模糊的情况中;情境中没有指派责任者最易受影响。persuasion 扰动导致系统性的方向性偏移。协议选择主导所有其他因素:结构化协议之间的一致性仅为 67.6%(kappa=0.55),且只有 35.7% 的 model-scenario 单元在所有三个协议中匹配。这些结果表明,LLM 道德判断是由叙事形式和任务脚手架共同生产的,这在结果依赖于呈现技巧而非道德实质内容时,引发了可重复性和公平性担忧。
引用
@article{arxiv.2603.05651,
title = {The Fragility Of Moral Judgment In Large Language Models},
author = {Tom van Nuenen and Pratik S. Sachdeva},
journal= {arXiv preprint arXiv:2603.05651},
year = {2026}
}
备注
22 pages, 7 figures, 10 tables, plus appendices