中文

理解与增强越狱攻击的可迁移性

机器学习 2025-05-20 v2 密码学与安全

摘要

越狱攻击能够有效操控开源大型语言模型(LLM)以产生有害响应。然而,这些攻击在迁移性方面存在限制,无法一致地干扰专有 LLM。为可靠识别专有 LLM 的漏洞,本 work 研究越狱攻击的迁移性,通过分析其对模型意图感知的影响。通过引入对抗序列,这些攻击可以将源 LLM 的注意力从原始输入中的恶意意图 token 上转移,从而阻止模型的意图识别并诱发有害响应。然而,这些对抗序列无法误导目标 LLM 的意图感知,使目标 LLM 能够重新聚焦于恶意意图 token 并中止响应。我们的分析进一步揭示,生成的对抗序列具有内在的分布依赖性,其有效性源于对源 LLM 参数的过拟合,导致其对目标 LLM 的迁移性有限。为此,我们提出了感知重要性平铺(PiF)方法,该方法在原始输入中均匀分布模型注意力于中性意图 token,从而在不依赖过拟合对抗序列的情况下遮蔽恶意意图 token。大量实验表明,PiF 为评估专有 LLM 提供了有效且高效的红队测试方法。

关键词

引用

@article{arxiv.2502.03052,
  title  = {Understanding and Enhancing the Transferability of Jailbreaking Attacks},
  author = {Runqi Lin and Bo Han and Fengwang Li and Tongling Liu},
  journal= {arXiv preprint arXiv:2502.03052},
  year   = {2025}
}

备注

Accepted by ICLR 2025