别把白熊想出来:认知负荷下变换模型的反讽否定现象
计算与语言
2025-11-18 v1 人工智能
摘要
诸如“请勿提及 ”的否定指令会以悖论方式增加 在人类思维中的可及性,称为反讽反弹。大型语言模型(LLM)面临同样的挑战:抑制概念需要内部激活它,这可能导致反弹而非规避。我们通过两个实验来检验这一张力。\textbf{(1) 负荷与内容}:在否定指令后,我们变化干扰文本(语义、句法、重复)并测量反弹强度。\textbf{(2) 意义分离}:我们测试模型是否区分相同概念的中性与否定表述,以及这种分离是否预测反弹的持续性。结果表明,否定后立即出现反弹,并随更长或语义干扰而加剧,而重复有助于抑制。更强的意义分离与更持久的反弹相关。结合识别稀疏中间层注意力头放大禁忌标记而早期层抑制的电路追踪分析,这些发现将认知对反讹反弹的预测与对长程干扰的机制性见解联系起来。为支持未来工作,我们发布了 ReboundBench 数据集,包含 5000 组系统变化的否定提示,用于探测 LLM 中的反弹。
引用
@article{arxiv.2511.12381,
title = {Don't Think of the White Bear: Ironic Negation in Transformer Models Under Cognitive Load},
author = {Logan Mann and Nayan Saxena and Sarah Tandon and Chenhao Sun and Savar Toteja and Kevin Zhu},
journal= {arXiv preprint arXiv:2511.12381},
year = {2025}
}