X-Teaming:基于自适应多智能体的多回合越狱与防御
摘要
与语言模型(LM)的多回合 interaction 构成 critical safety risk,因为有害意图可以 strategic 地在 exchange 中传播。尽管如此,vast majority prior work focus 于 single-turn safety,而 adaptability 和 diversity 仍是 multi-turn red-teaming 中的 key 挑战。为 address these 挑战,我们提出了X-Teaming,一个 scalable framework,systematically explore 看似无害的 interaction如何 escalation 到有害 outcome,并生成相应的 attack scenario。X-Teaming employs collaborative agents for planning、attack optimization和 verification,实现了在 representative leading open-weight 和 closed-source models上达到最高达98.1%的 multi-turn jailbreak effectiveness 和 diversity。特别是,X-Teaming对最新被认为几乎免疫于 single-turn attack的Claude 3.7 Sonnet model实现了96.2%的 attack success rate。基于X-Teaming,我们引入XGuard-Train,一个开源的 multi-turn safety training dataset,规模是 previous best resource的20倍,包含30K interactive jailbreaks,旨在 enable robust multi-turn safety alignment for LMs。我们的 work为缓解 sophisticated conversational attacks 提供了 essential tools 和 insights,推进了 LMs的 multi-turn safety。
引用
@article{arxiv.2504.13203,
title = {X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents},
author = {Salman Rahman and Liwei Jiang and James Shiffer and Genglin Liu and Sheriff Issaka and Md Rizwan Parvez and Hamid Palangi and Kai-Wei Chang and Yejin Choi and Saadia Gabriel},
journal= {arXiv preprint arXiv:2504.13203},
year = {2025}
}