中文

多轮越狱攻击的表示工程视角分析

密码学与安全 2025-07-08 v1 人工智能

摘要

最近的研究表明,先进的大语言模型及其防御机制仍然容易受到多轮越狱攻击的威胁。这些攻击仅需闭箱模型访问,手工操作相对容易,构成对基于大语言模型系统的安全部署的重大威胁。我们从中间模型表示层面研究了 Crescendo 多轮越狱的有效性,发现安全对齐的语言模型在表示层面常将 Crescendo 回复表示为更良好,而非有害,尤其在对话轮数增加时更为如此。我们的分析表明,每一轮的 Crescendo 提示倾向于将模型输出保持在表示空间的“良好”区域,从而有效地欺骗模型履行有害请求。进一步,我们的结果帮助解释了为何单轮越狱防御(如电路断路器)通常对多轮攻击无效,激发了针对这一泛化差距开发缓解措施的动力。

关键词

引用

@article{arxiv.2507.02956,
  title  = {A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks},
  author = {Blake Bullwinkel and Mark Russinovich and Ahmed Salem and Santiago Zanella-Beguelin and Daniel Jones and Giorgio Severi and Eugenia Kim and Keegan Hines and Amanda Minnich and Yonatan Zunger and Ram Shankar Siva Kumar},
  journal= {arXiv preprint arXiv:2507.02956},
  year   = {2025}
}