中文

利用动量增强越狱攻击

机器学习 2025-03-04 v2 人工智能 计算与语言 密码学与安全 最优化与控制

摘要

大型语言模型(LLMs)在各类任务中取得了显著成功,但它们仍然容易受到对抗攻击,尤其是众所周知的越狱攻击。具体而言,贪婪坐标梯度(GCG)攻击通过结合梯度启发式和贪婪搜索来优化对抗提示,已证明在利用此漏洞方面十分有效。然而,这种攻击的效率已成为攻击过程中的瓶颈。为了缓解这一限制,在本文中,我们通过优化的视角重新思考对抗提示的生成,旨在稳定优化过程并从先前的优化迭代中获取更多启发式见解。具体而言,我们提出了动量加速 GCG(MAC)攻击,它将动量项集成到梯度启发式中,以增强并稳定对抗提示中 token 的随机搜索。实验结果表明,MAC 在攻击成功率和优化效率方面均显著优于基线。此外,我们证明 MAC 在迁移攻击和具有防御机制的模型上仍能表现出优越的性能。我们的代码可在 https://github.com/weizeming/momentum-attack-llm 获取。

关键词

引用

@article{arxiv.2405.01229,
  title  = {Boosting Jailbreak Attack with Momentum},
  author = {Yihao Zhang and Zeming Wei},
  journal= {arXiv preprint arXiv:2405.01229},
  year   = {2025}
}

备注

Accepted by ICASSP 2025