中文

语义重力井:为何负约束适得其反

人工智能 2026-01-14 v1 计算与语言

摘要

负约束(形式为“不要使用词X”的指令)是大型语言模型指令遵循能力的基本测试。尽管这些约束看似简单,但却以惊人的频率失败,其失效的条件长期以来一直鲜为人知。本文提出了负指令失效的首个全面机制性调查。我们引入语义压力,即模型生成禁止标记的内在概率的量化度量,证明了违反概率与压力之间存在紧密的 logistic 关系(p=σ(2.40+2.27P0)p=\sigma(-2.40+2.27\cdot P_0)n=40,000n=40,000 样本;bootstrap 95% CI for slope: [2.21,,2.33][2.21,,2.33])。通过基于 logit 镜头技术的层级分析,我们确立了负指令引发的抑制信号在失效中虽存在,却在系统性上弱得多:指令在失效时的抑制仅为成功时的 5.2 个百分点,而成功时为 22.8 个百分点——为 4.4×4.4\times 的不对称。我们将这种不对称归因于两种机制上不同的失效模式。在 priming 失效(87.5% 的违规)中,指令对禁止词的显式提及反向地激活了目标表示。而在 override 失效(12.5%)中,晚层前馈网络的贡献为 +0.39+0.39,几乎为成功时的 4×4\times,压倒了早期的抑制信号。通过激活修补,我们确认第 23-27 层在因果上负责:替换这些层的激活会翻转约束效应的符号。我们的发现揭示了负约束设计的根本张力:对禁止词的命名行为本身会使模型倾向于生成该词。

关键词

引用

@article{arxiv.2601.08070,
  title  = {Semantic Gravity Wells: Why Negative Constraints Backfire},
  author = {Shailesh Rana},
  journal= {arXiv preprint arXiv:2601.08070},
  year   = {2026}
}

备注

10 pages, 8 figures. Code: https://github.com/gut-puncture