神经变色龙:语言模型能学会向未见过的激活监测器隐藏其思维
机器学习
2025-12-16 v1
摘要
激活监测使用轻量级分类器探测模型的内部状态,是 AI 安全领域的一种新兴工具。然而,在错位威胁模型下——即模型可能学会主动隐藏其内部状态——其最坏情况下的鲁棒性仍未得到测试。聚焦于这一威胁模型,我们提出:模型能否学会规避此前未见过的激活监测器?我们的核心贡献是对这种行为的可学习性进行压力测试。我们证明,微调可以创造出神经变色龙:能够零样本规避激活监测器的模型。具体而言,我们微调一个 LLM,使其在以“你正在被探测 {concept}”为触发条件时,规避针对一组良性概念(例如语言、HTML)的监测器。我们表明这种学习到的机制可以零样本泛化:通过将 {concept} 替换为与安全相关的术语(如“欺骗”),模型成功规避了此前未见过的安全监测器。我们在不同的模型系列(Llama、Gemma、Qwen)中验证了这一现象,表明即使在针对模型冻结权重进行事后训练的监测器面前,这种规避也能成功。这种规避具有高度选择性,仅针对触发器中提及的特定概念,且对标准基准测试中的模型能力影响有限。以 Gemma-2-9b-it 为案例研究,机制分析揭示这是通过将激活移动到低维子空间的定向操纵实现的。尽管像监测器集成和非线性分类器等更强的防御措施表现出更强的抵抗力,但模型仍保留了不可忽视的规避能力。我们的工作为这种失效模式提供了概念验证,并提供了一种工具来评估监测技术针对错位威胁模型的最坏情况鲁棒性。
引用
@article{arxiv.2512.11949,
title = {Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors},
author = {Max McGuinness and Alex Serrano and Luke Bailey and Scott Emmons},
journal= {arXiv preprint arXiv:2512.11949},
year = {2025}
}