中文

AutoAdv:用于大型语言模型多轮越狱的自动对抗性提示

计算与语言 2025-12-23 v3 人工智能 密码学与安全 机器学习

摘要

大型语言模型(LLM)仍然容易受到越狱攻击,攻击者会通过对抗性提示来生成有害输出。然而,大多数评估仅关注单轮交互,而现实中的攻击则通过自适应的多轮对话来展开。我们提出AutoAdv,这是一个无需训练的多轮自动化越狱框架,在Llama-3.1-8B上实现了最高95%的攻击成功率,仅用六轮对话,比单轮基线提高了24%。AutoAdv独特地结合了三个自适应机制:一个从成功攻击中学习以增强未来提示的模式管理器、一个根据失败模式动态调整采样参数的温度管理器,以及一种两种阶段的重写策略,用以隐蔽有害请求并逐步细化它们。对商业和开源模型(Llama-3.1-8B、GPT-4o mini、Qwen3-235B、Mistral-7B)进行了广泛评估,揭示了当前安全机制仍然存在漏洞,多轮攻击始终优于单轮方法。这些发现表明,针对单轮交互优化的对齐策略在延长的对话中无法保持鲁棒性,凸显了迫切需要针对多轮对话的防御措施。

关键词

引用

@article{arxiv.2511.02376,
  title  = {AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models},
  author = {Aashray Reddy and Andrew Zagula and Nicholas Saban},
  journal= {arXiv preprint arXiv:2511.02376},
  year   = {2025}
}

备注

Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv