中文

当禁令变成许可:审计语言模型中的否定敏感性

人工智能 2026-01-30 v1

摘要

当用户告诉AI系统某人“不应该”采取某个行动时,系统应将其视为禁令。然而,许多大型语言模型却反其道而行之:它们将否定指令解释为肯定。我们审计了16个模型在14个伦理场景下的表现,发现开源模型在简单否定下77%的情况下认可被禁止的行为,在复合否定下100%认可——相比肯定框架增加了317%。商业模型表现更好,但仍显示出19-128%的波动。模型间的一致性从肯定提示下的74%下降到否定提示下的62%,且金融场景的脆弱性是医疗场景的两倍。这些模式在确定性解码下依然成立,排除了采样噪声。我们通过案例研究展示了这些失败在实践中如何发生,提出了否定敏感性指数(NSI)作为治理指标,并概述了一个具有领域特定阈值的分级认证框架。研究结果指出了当前对齐技术所能达到的目标与安全部署所需之间的差距:无法可靠区分“做X”和“不做X”的模型不应在高风险情境中做出自主决策。

关键词

引用

@article{arxiv.2601.21433,
  title  = {When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models},
  author = {Katherine Elkins and Jon Chun},
  journal= {arXiv preprint arXiv:2601.21433},
  year   = {2026}
}

备注

13 pages, 5 figures