中文

从盗窃到制作炸弹:无学习在防御越狱攻击中的涟漪效应

密码学与安全 2025-05-21 v3 计算与语言 机器学习

摘要

大型语言模型 (LLM) 已知 vulnerable 于越狱攻击。一个重要观察是,虽然不同类型的越狱攻击可以生成显著不同的查询,但它们大多数情况下会导致类似的响应,这些响应根植于相同的有害知识之中(例如,制作炸弹的详细步骤)。因此,提出了基于无学习的方法,通过直接从模型中移除有害知识来缓解越狱攻击。在本文中,我们识别出一种新型的无学习涟漪效应,其中 LLM 可以在无学习阶段未明确引入的有害知识方面进行隐式无学习(例如,模型在学习盗窃的步骤后,还能隐式地取消学习制作炸弹的步骤)。通过多个模型、攻击策略和防御方法跨越 100 多个实验运行,我们经验上验证了这一现象,这使得基于无学习的方法能够仅使用 100 个训练样本,将对未见数据的攻击成功率降低到 10% 以下。进一步分析表明,无学习的强大泛化能力可能源于有害响应之间内在的相关性(例如,响应模式、在响应中共享的步骤和动作,以及它们在 LLM 中学习表示的相似性)。我们也讨论了无学习的潜在局限性以及观察到的涟漪效应。我们希望我们的研究能够促进对无学习的更深入理解。我们的代码可在 https://github.com/thu-coai/SafeUnlearning 上获取。

关键词

引用

@article{arxiv.2407.02855,
  title  = {From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks},
  author = {Zhexin Zhang and Junxiao Yang and Yida Lu and Pei Ke and Shiyao Cui and Chujie Zheng and Hongning Wang and Minlie Huang},
  journal= {arXiv preprint arXiv:2407.02855},
  year   = {2025}
}

备注

19 pages