弥合激活锥盲区:响应时间探测与统一防御
摘要
针对大型语言模型的推理时安全方法激增,但尚无系统性比较。我们评估了五种防御范式(无防御、静态引导、CAST、AlphaSteer、探测门控),涵盖七个指令微调模型(7-31B)和五种攻击类型(GCG、AutoDAN、DeepInception、预填充、意图洗白)。我们的核心发现:提示时激活防御在结构上对预填充攻击视而不见。AlphaSteer在GCG、AutoDAN和意图洗白上实现了0%的攻击成功率,但在预填充上为50%。我们证明了一个推论:任何在单层激活与良性参考(锥、子空间或零空间)的对齐上门控干预的防御,都对精心构造激活以使其位于该参考内的攻击视而不见,无论是在提示时还是逐token检查。作为其建设性的逆否命题,我们引入了响应时间探测:在模型生成的前几个token的隐藏状态上进行线性探测,在所有七个模型上的AUROC为0.97-1.00。结合停止生成,它将每个模型上的预填充攻击成功率降至0/40,良性误报率为0%,优于Llama Guard 3。跨模板泛化取决于探测深度,因此我们将声明范围限定在规范的预填充模板族。将响应停止与AlphaSteer的零空间引导相结合,提供了一个正交的划分(停止捕获预填充,AlphaSteer捕获语义攻击),在Mistral上达到0.983的防御成功率,在Llama上达到0.994,优于两个组成部分。我们进一步表明,MMLU未能捕捉到引导的真实效用成本,该成本表现为行为对冲而非事实损失,并且多样化的负训练集将探测误报率从80-100%降至接近零。代码、攻击、逐样本结果和评判提示均已发布。
引用
@article{arxiv.2606.29441,
title = {Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense},
author = {Subhadip Mitra},
journal= {arXiv preprint arXiv:2606.29441},
year = {2026}
}
备注
27 pages, 12 figures, 18 tables. Code and data: https://github.com/bassrehab/response-time-probing