中文

方向翻转影响审计揭示 LLM 道德选择中的隐藏结构

机器学习 2026-05-11 v2 人工智能 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

道德基准测试通常在无上下文提示下对 LLM 进行评分,隐含地将测量的选择率视为稳定。我们通过方向翻转影响审计来测试这一假设:对于每个情景,我们比较基线提示与引导 toward 选项 A 或选项 B 的匹配线索。在一组以坦rolley 问题为灵感的道德急诊任务、BBQ 和 DailyDilemmas 中,以及在五个 LLM 家族(带无推理、无推理)中,短上下文线索将各条件选择率平均偏移 12-18 个百分点。这些偏移揭示了基线得分遗漏的结构:约 40% 的基线中性急诊和 BBQ 条件在影响下显示方向性不对称,而显著效果的一个 meaningful 份比例反向移动,偏离线索意图的方向。在后续探测中,模型常常认识到线索,却否认它影响了自己的选择。在显著反向试验中,这种 stated-vs.-revealed 不一致在 78% 的案例中出现。推理并不消除情境灵敏度,而是重新塑造它:社会压力线索如用户偏好和情感诉求在各基准测试中减弱,而少量演示在急诊和 BBQ 上显著增强。我们建议将方向翻转影响对作为 context-free 道德偏差评估的标准补充品,並发布该 harness 和数据以便 routine 实施此类审计。

关键词

引用

@article{arxiv.2602.22831,
  title  = {Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs},
  author = {Phil Blandfort and Tushar Karayil and Alex McKenzie and Urja Pawar and Robert Graham and Dmitrii Krasheninnikov},
  journal= {arXiv preprint arXiv:2602.22831},
  year   = {2026}
}