中文

ASGuard:缓解定向越狱攻击的激活缩放防护机制

人工智能 2026-04-15 v2

摘要

大语言模型(LLM)尽管经过了安全对齐,但仍表现出脆弱的拒绝行为,这些行为可以通过简单的语言变化来规避。正如时态越狱所表明的那样,拒绝有害请求的模型在被改写为过去时往往会顺从,这揭示了当前对齐方法中存在的一个关键泛化鸿沟,而其底层机制却知之甚少。在本工作中,我们引入了激活缩放防护机制(Activation-Scaling Guard, ASGuard),这是一个富有洞察力且基于机制分析启发的框架,能够精准缓解这一特定漏洞。在第一步中,我们使用电路分析来识别与定向越狱(如时态更改攻击)存在因果联系的特定注意力头。其次,我们训练一个精确的逐通道缩放向量,以重新校准易受时态攻击影响的注意力头的激活。最后,我们将其应用于“预防性微调”,迫使模型学习更稳健的拒绝机制。在四个 LLM 上,ASGuard 有效降低了定向越狱的攻击成功率,同时保持了通用能力并最大限度地减少了过度拒绝,实现了安全性与实用性之间的帕累托最优平衡。我们的发现基于机制分析,强调了对抗性后缀如何抑制拒绝介导方向的传播。此外,我们的工作展示了如何利用对模型内部机制的深入理解来开发实用、高效且有针对性的模型行为调整方法,为实现更可靠和可解释的 AI 安全指明了方向。

关键词

引用

@article{arxiv.2509.25843,
  title  = {ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack},
  author = {Yein Park and Jungwoo Park and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2509.25843},
  year   = {2026}
}

备注

ICLR 2026, 29 pages, 11 figures