中文

解码前的拒绝:检测和利用 LLM 中中间激活的拒绝信号

人工智能 2026-05-28 v1 密码学与安全

摘要

本文探讨了是否可以在解码前从 LLM 中间激活预测拒绝行为,这种方法通过在每个 transformer 块的残差流激活上训练的线性探针来实现。我们发现,拒绝行为在最终层之前即可被良好地线性解码,这表明安全相关行为在输出生成前已体现于中间激活中。为测试该信号是否可操作,我们引入了Mechanistic AutoDAN,这是一种基于探针引导的 AutoDAN 变体,用部分前向传递和探针评分取代完整模型适应度评估,置于遗传提示搜索循环中。在所评估的模型中,该方法在 achieving 与 vanilla AutoDAN 相当的攻击成功率的同时,将每迭代搜索时间降低最高可达 72%,且探针引导的提示在多个配置下匹配或超越 AutoDAN 的跨模型迁移。我们进一步发现,探针引导的有用性随模型规模而增大。我们的结果表明,拒绝不仅在输出层可观测,而且被编码为中间 LLM 激活中结构化且可操作的信号。

关键词

引用

@article{arxiv.2605.28553,
  title  = {Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations},
  author = {Matteo Gioele Collu and Riccardo Conte and Alberto Giaretta and Denis Kleyko and Mauro Conti and Matteo Zavatteri and Roberto Confalonieri},
  journal= {arXiv preprint arXiv:2605.28553},
  year   = {2026}
}