AutoDAN-Reasoning:基于测试时扩展提升越狱攻击策略探索的自动方法
密码学与安全
2025-10-09 v2 人工智能
摘要
最近的越狱大语言模型(LLM)的自动化方法,如 AutoDAN-Turbo,已展示了自动化策略发现的潜力。AutoDAN-Turbo 采用终身学习智能体从零开始构建丰富的攻击策略库。虽然此方法效果显著,但其测试时生成过程仅对采样的策略进行采样,并生成单个对应的攻击提示,未能充分发挥已学习策略库的潜力。本文提出通过测试时扩展进一步提升 AutoDAN-Turbo 的攻击性能。我们引入两种不同的扩展方法:最佳-N 方法和光束搜索方法。最佳-N 方法从采样的策略生成 N 个候选攻击提示,并基于评分模型选择最有效的一个。光束搜索方法通过探索策略库中策略的组合,以发现更强大和协同的攻击向量。实验表明,所提方法显著提升了性能,光束搜索在 Llama-3.1-70B-Instruct 上将攻击成功率提高最高可达 15.6 个百分点,相较于 vanilla 方法在 GPT-o4-mini 上实现近 60% 的相对提升。
引用
@article{arxiv.2510.05379,
title = {AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling},
author = {Xiaogeng Liu and Chaowei Xiao},
journal= {arXiv preprint arXiv:2510.05379},
year = {2025}
}
备注
Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning