中文

GASP:用于劫持LLM的高效黑盒生成对抗后缀

机器学习 2025-11-07 v3 人工智能 密码学与安全 计算机视觉与模式识别

摘要

大语言模型(LLM)在 various natural language processing tasks 中展现出惊人的能力,但仍然容易受到输入提示攻击,这些攻击被称为劫持攻击,精心设计的提示可绕过安全警戒并诱发有害响应。传统方法依赖手动启发式方法,但存在可移植性有限的问题。尽管自动化方法已存在,但往往产生不自然的提示,且可能被安全过滤器轻易检测,或由于离散标记优化而需要高计算成本。本文引入生成对抗后缀提示器(GASP),一种新型自动化框架,可在完全黑盒设置下高效生成人类可读的劫持提示。具体而言,GASP利用潜在贝叶斯优化来构建对抗后缀,通过高效探索连续潜在嵌入空间,逐步优化后缀提示器以提高攻击效果,同时通过针对性的迭代细化程序平衡提示的连贯性。通过全面实验,我们表明GASP能够产生自然的对抗提示,显著提高劫持成功率,减少训练时间,加快推理速度,从而成为一种高效且可扩展的LLM红队测试解决方案。

关键词

引用

@article{arxiv.2411.14133,
  title  = {GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs},
  author = {Advik Raj Basani and Xiao Zhang},
  journal= {arXiv preprint arXiv:2411.14133},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. Project page and demos: https://air-ml.org/project/gasp/