基于树状结构的对话强化策略优化:用于红队攻击
机器学习
2026-03-10 v2 人工智能
计算与语言
摘要
尽管近期在AI安全方面取得了快速进展,当前的大型语言模型在多轮交互场景中仍然容易受到对抗攻击,攻击者会在对话轮次之间战略性地调整提示,构成更为关键且符合现实情况的挑战。现有方法要么依赖人类专家的手动红队测试,要么使用预定义模板和人类精选的攻击数据进行自动化方法,大多数聚焦于单轮攻击。然而,这些方法未能探索大量可能的多轮攻击空间,未能考虑源于复杂对话动态和战略性对话规划而产生的新型攻击轨迹。这一差距尤为关键,因为近期研究表明,LLM对多轮攻击的脆弱性显著高于单轮攻击。我们提出DialTree,一种集成树状搜索的在策略强化学习框架,通过将对话视为序列决策问题来自主发现多样化的多轮攻击策略,从而实现系统性探索,无需人工精选数据。通过大量实验,我们的方法不仅在12个目标模型上实现了比以前最先进方法高出44.2%的更高攻击成功率,还通过学习最大化跨多轮攻击成功率的优化对话策略,有效揭示了新的攻击策略。
引用
@article{arxiv.2510.02286,
title = {Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks},
author = {Ruohao Guo and Afshin Oroojlooy and Roshan Sridhar and Miguel Ballesteros and Alan Ritter and Dan Roth},
journal= {arXiv preprint arXiv:2510.02286},
year = {2026}
}
备注
Accepted at ICLR 2026