中文

基于对抗提示蒸馏的 LLMs 到 SLMs 的高效且隐形的越狱攻击

计算与语言 2025-12-23 v2 密码学与安全

摘要

随着针对大型语言模型 (LLMs) 的越狱攻击规模和复杂度的不断提升,这些攻击的效率和实际适用性受到限制,这构成了 LLM 安全的深刻挑战。越狱技术的发展从手动提示工程发展到自动化方法。最近的进展自动化了越狱方法,这些方法利用 LLMs 生成越狱指令和对抗性示例,取得了鼓舞人心的效果。然而,这些方法普遍包括 LLM 生成阶段 due to 部署和推理 LLMs 的复杂性,阻碍了有效实施和更广泛的采用。为缓解此问题,我们引入了{\textbf{对抗提示蒸馏},一种创新的框架集成了遮盖语言模型、强化学习和动态温度控制,将 LLMs 的越狱能力蒸馏到较小的语言模型 (SLMs)。这种方法使越狱攻击高效、稳健,同时保持高成功率,适应更广泛的应用场景。经验评估确认了该方法在攻击效能、资源优化和跨模型通用性方面的优势。我们的研究凸显了将越狱能力转移到 SLMs 的实用性,揭示了 LLMs 中的内在漏洞,并为推进 LLM 安全研究提供了新见解。我们的代码可在 https://github.com/lxgem/Efficient_and_Stealthy_Jailbreak_Attacks_via_Adversarial_Prompt 获取。

关键词

引用

@article{arxiv.2506.17231,
  title  = {Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs},
  author = {Xiang Li and Chong Zhang and Jia Wang and Fangyu Wu and Yushi Li and Xiaobo Jin},
  journal= {arXiv preprint arXiv:2506.17231},
  year   = {2025}
}

备注

19 pages, 7 figures