中文

语言模型中的潜在空间攻击:拒绝回避

人工智能 2026-05-22 v1

摘要

安全对齐的语言模型被训练以拒绝有害请求,但通过引导其内部表示可以抑制拒绝行为。现有方法通过消除模型激活中的拒绝方向来实现此目的,旨在从模型的残差流中移除拒绝。尽管这些方法在实证上成功,但缺乏对潜在空间转换所引起的原理性解释,以及为何抑制拒绝的原理性解释。本文将拒绝抑制重新诠释为针对线性探针的潜在空间攻击,这些探针用于分离被拒绝的提示和已答复的提示。在此观点下,先前工作的差分-平均方向自然定义为此类探针,其消除恰好是对其决策边界的投影,即最小置信度攻击。这种视角不仅解释了先前工作的实证成功,还暴露了关键局限性:攻击在决策边界处即止步,这就需要将表示推进到合规区域,即模型答复的区域。我们通过提出一种受控潜在空间攻击,利用优化置信度将表示投影到边界之外,从而实现此目标。在15个指令调校、多模态和推理模型上,我们实现了最高的攻击成功率,超越了现有的拒绝消除基准和专门的越狱攻击。

关键词

引用

@article{arxiv.2605.21706,
  title  = {Latent-space Attacks for Refusal Evasion in Language Models},
  author = {Giorgio Piras and Raffaele Mura and Fabio Brau and Maura Pintor and Luca Oneto and Fabio Roli and Battista Biggio},
  journal= {arXiv preprint arXiv:2605.21706},
  year   = {2026}
}