语言模型识别其激活所施加的 dropout 和高斯噪声
人工智能
2026-05-04 v2
摘要
我们提供证据表明,语言模型能够检测、局部化,并以一定程度上语言化施加到其激活的扰动之间的差异。更准确地说,我们要么(a)屏蔽激活,模拟 dropout,要么(b)向其在目标句子上的激活添加高斯噪声。随后我们询问多选问题,例如“上述哪些句子被扰动了?”或“哪种扰动被应用了?”。我们测试了来自 Llama、Olmo 和 Qwen 系列的模型,规模在 8B 到 32B 之间,所有模型都能轻易检测并局部化扰动,往往精确无误。这些模型还能学习,当在上下文中教导时,区分 dropout 和高斯噪声。值得注意的是,Qwen3-32B 在识别所应用扰动的零样本准确率随扰动强度的函数而提高,此外,如果上下文标签被翻转,它的准确率会下降,这表明即使在控制modulo的情况下,也存在对正确标签的先验。由于 dropout 被用作训练正则化技术,而高斯噪声有时在推理期间添加,我们讨论了数据无关的“训练意识”信号的可能性以及对 AI 安全的影响。
引用
@article{arxiv.2604.17465,
title = {Language models recognize dropout and Gaussian noise applied to their activations},
author = {Damiano Fornasiere and Mirko Bronzi and Spencer Kitts and Alessandro Palmas and Yoshua Bengio and Oliver Richardson},
journal= {arXiv preprint arXiv:2604.17465},
year = {2026}
}