AutoAdv:用于大型语言模型多轮越狱的自动对抗性提示
计算与语言
2025-12-23 v3 人工智能
密码学与安全
机器学习
摘要
大型语言模型(LLM)仍然容易受到越狱攻击,攻击者会通过对抗性提示来生成有害输出。然而,大多数评估仅关注单轮交互,而现实中的攻击则通过自适应的多轮对话来展开。我们提出AutoAdv,这是一个无需训练的多轮自动化越狱框架,在Llama-3.1-8B上实现了最高95%的攻击成功率,仅用六轮对话,比单轮基线提高了24%。AutoAdv独特地结合了三个自适应机制:一个从成功攻击中学习以增强未来提示的模式管理器、一个根据失败模式动态调整采样参数的温度管理器,以及一种两种阶段的重写策略,用以隐蔽有害请求并逐步细化它们。对商业和开源模型(Llama-3.1-8B、GPT-4o mini、Qwen3-235B、Mistral-7B)进行了广泛评估,揭示了当前安全机制仍然存在漏洞,多轮攻击始终优于单轮方法。这些发现表明,针对单轮交互优化的对齐策略在延长的对话中无法保持鲁棒性,凸显了迫切需要针对多轮对话的防御措施。
引用
@article{arxiv.2511.02376,
title = {AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models},
author = {Aashray Reddy and Andrew Zagula and Nicholas Saban},
journal= {arXiv preprint arXiv:2511.02376},
year = {2025}
}
备注
Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv