中文

AdvPrompter:针对 LLM 的快速自适应对抗性提示

密码学与安全 2025-06-04 v2 人工智能 计算与语言 机器学习

摘要

大型语言模型(LLM)容易受到越狱攻击,从而生成不当或有害内容。人工红队测试需要耗时搜索对抗性提示,而自动对抗性提示生成通常会导致语义无意义的攻击,且难以扩展。在本文中,我们提出了一种新方法,使用另一个称为 AdvPrompter 的 LLM 在几秒钟内生成人类可读的对抗性提示。AdvPrompter 使用交替优化算法进行训练,生成掩盖输入指令但不改变其含义的后缀,从而诱导 TargetLLM 给出有害响应。在流行的开源 TargetLLM 上的实验结果表明,在 AdvBench 和 HarmBench 数据集上取得了极具竞争力的结果,并且这些结果可迁移至闭源黑盒 LLM。我们还表明,使用 AdvPrompter 生成的对抗性后缀进行训练,是提高 LLM 抵御越狱攻击鲁棒性的一种有前景的策略。

关键词

引用

@article{arxiv.2404.16873,
  title  = {AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs},
  author = {Anselm Paulus and Arman Zharmagambetov and Chuan Guo and Brandon Amos and Yuandong Tian},
  journal= {arXiv preprint arXiv:2404.16873},
  year   = {2025}
}

备注

Accepted to ICML 2025. Code is available at http://github.com/facebookresearch/advprompter