中文

AttnGCG:通过注意力操控增强LLM的攻击性

计算与语言 2024-10-14 v1

摘要

本文研究了基于变压器的大型语言模型(LLM)针对攻击性的脆弱性,具体聚焦于优化性的贪心坐标梯度(GCG)策略。我们首先观察到攻击有效性与模型内部行为之间存在正相关性。例如,当模型更关注确保LLM安全对齐的系统提示时,攻击往往不够有效。基于这一发现,我们引入一种操控模型注意力分数以促进LLM攻击性的方法,称之为AttnGCG。经验上,AttnGCG在 diverse LLMs中均实现了攻击性提升,Llama-2系列平均提升约7%,Gemma系列平均提升约10%。我们的策略还显示出对未知有害目标和类黑盒LLM如GPT-3.5和GPT-4的攻击性传递具有鲁棒性。此外,我们注意到注意力得分可视化更具可解释性,帮助我们更好地理解如何通过针对性注意力操控来实现更有效的攻击性。我们已在https://github.com/UCSC-VLAA/AttnGCG-attack发布代码。

关键词

引用

@article{arxiv.2410.09040,
  title  = {AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation},
  author = {Zijun Wang and Haoqin Tu and Jieru Mei and Bingchen Zhao and Yisen Wang and Cihang Xie},
  journal= {arXiv preprint arXiv:2410.09040},
  year   = {2024}
}