暗影中操控:大型语言模型中激活空间攻击的因果放大
密码学与安全
2025-11-24 v1
摘要
现代大型语言模型(LLM)通常通过审计数据、提示和拒绝政策进行安全防护,而将前向传递视为实现细节。我们表明,解码器-only LLM 的中间激活构成了行为控制的脆弱攻击面。基于最近关于注意力汇 sink 和压缩谷的发现,我们识别了残差流中一个高增益区域,其中小幅 well 对齐扰动在自回归轨迹中被因果放大——这被称为因果放大效应(CAE)。我们利用这一点作为攻击面,通过灵敏度比例操控(SSS),一种渐进的激活水平攻击,将起始-序列(BOS)锚定与灵敏度基于的强化结合,以将有限扰动预算聚焦于最脆弱的层和标记。我们表明,SSS 在多个开源模型和四个行为轴上引起对 evil、幻觉、讨好和情感的大幅偏移,同时保持高一致性和通用能力,将激活操控转化为面向 white-box 和供应链 LLM 部署的具体安全问题。
引用
@article{arxiv.2511.17194,
title = {Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models},
author = {Zhiyuan Xu and Stanislav Abaimov and Joseph Gardiner and Sana Belguith},
journal= {arXiv preprint arXiv:2511.17194},
year = {2025}
}
备注
31 pages, 5 figures, 9 tables