中文

AttentionDefense:利用系统提示注意力实现针对新型越狱的可解释防御

计算与语言 2025-04-18 v1 人工智能

摘要

在过去几年中,语言模型 (LM) 在多个领域展现出了超越人类的能力。尽管其实际应用广泛且用户使用量巨大,但当恶意输入利用 LM 的弱点时,它们容易受到越狱攻击,导致其偏离预期行为。当前的防御策略要么将输入提示分类为对抗性提示,要么阻止 LM 生成有害输出。然而,解释越狱恶意本质背后的原因具有挑战性,这导致了种类繁多的黑盒方法。在本研究中,我们提出并证明,来自小型语言模型 (SLM) 的系统提示注意力可用于表征对抗性提示,提供了一种新颖、可解释且成本更低的防御方法,称为 AttentionDefense。我们的研究表明,注意力机制是理解和解释 LM 如何响应恶意输入的重要组成部分,而这在文本嵌入的语义含义中并未被捕捉。所提出的 AttentionDefense 在现有的越狱基准数据集上进行了评估。消融研究表明,基于 SLM 的 AttentionDefense 在越狱检测性能上与基于文本嵌入的分类器和 GPT-4 零样本检测器相当或更优。为了进一步验证所提方法的有效性,我们使用基于闭环 LLM 的多智能体系统生成了现有基准数据集的新型越狱变体数据集。我们证明,所提出的 AttentionDefense 方法在此新型越狱数据集上表现稳健,而现有方法的性能则受损。此外,出于实用目的,AttentionDefense 是一种理想的解决方案,因为它具有小型 LM 的计算需求,却具备 LLM 检测器的性能。

关键词

引用

@article{arxiv.2504.12321,
  title  = {AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks},
  author = {Charlotte Siska and Anush Sankaran},
  journal= {arXiv preprint arXiv:2504.12321},
  year   = {2025}
}