中文

LLMStinger:基于强化学习微调的大语言模型实施越狱攻击

机器学习 2026-01-29 v2 密码学与安全

摘要

我们提出 LLMStinger,一种利用大语言模型(LLM)自动生成越狱攻击对抗性后缀的新方法。与需要复杂提示工程或白盒访问的传统方法不同,LLMStinger 采用强化学习(RL)循环微调攻击者 LLM,基于现有攻击为 HarmBench 基准中的有害问题生成新后缀。与 15 种最新红队方法相比,我们的方法显著优于现有方法,在 LLaMA2-7B-chat 上攻击成功率(ASR)提升 +57.2%,在 Claude 2 上提升 +50.3%,这两个模型以其广泛的安全措施著称。此外,我们在 GPT-3.5 上达到 94.97% ASR,在 Gemma-2B-it 上达到 99.4% ASR,展示了 LLMStinger 在开源和闭源模型上的鲁棒性和适应性。

关键词

引用

@article{arxiv.2411.08862,
  title  = {LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs},
  author = {Piyush Jha and Arnav Arora and Vijay Ganesh},
  journal= {arXiv preprint arXiv:2411.08862},
  year   = {2026}
}

备注

Accepted at AAAI 2025