中文

X-Teaming:基于自适应多智能体的多回合越狱与防御

密码学与安全 2025-08-26 v2 人工智能 计算与语言 机器学习 多智能体系统

摘要

与语言模型(LM)的多回合 interaction 构成 critical safety risk,因为有害意图可以 strategic 地在 exchange 中传播。尽管如此,vast majority prior work focus 于 single-turn safety,而 adaptability 和 diversity 仍是 multi-turn red-teaming 中的 key 挑战。为 address these 挑战,我们提出了X-Teaming,一个 scalable framework,systematically explore 看似无害的 interaction如何 escalation 到有害 outcome,并生成相应的 attack scenario。X-Teaming employs collaborative agents for planning、attack optimization和 verification,实现了在 representative leading open-weight 和 closed-source models上达到最高达98.1%的 multi-turn jailbreak effectiveness 和 diversity。特别是,X-Teaming对最新被认为几乎免疫于 single-turn attack的Claude 3.7 Sonnet model实现了96.2%的 attack success rate。基于X-Teaming,我们引入XGuard-Train,一个开源的 multi-turn safety training dataset,规模是 previous best resource的20倍,包含30K interactive jailbreaks,旨在 enable robust multi-turn safety alignment for LMs。我们的 work为缓解 sophisticated conversational attacks 提供了 essential tools 和 insights,推进了 LMs的 multi-turn safety。

关键词

引用

@article{arxiv.2504.13203,
  title  = {X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents},
  author = {Salman Rahman and Liwei Jiang and James Shiffer and Genglin Liu and Sheriff Issaka and Md Rizwan Parvez and Hamid Palangi and Kai-Wei Chang and Yejin Choi and Saadia Gabriel},
  journal= {arXiv preprint arXiv:2504.13203},
  year   = {2025}
}