RedDebate:通过多智能体辩论实现更安全的回复
计算与语言
2025-10-13 v2
摘要
我们介绍 RedDebate,一种新的多智能体辩论框架,为大语言模型 (LLM) 提供识别和缓解其不安全行为的基础。现有的 AI 安全方法往往依赖高成本的人类评估或孤立的单模型评估,两者都受到可扩展性限制且容易遗漏。RedDebate 采用多位 LLM 在多样化辩论场景中的协作论证,使它们能够批判性地评估彼此的推理,并通过完全自动化的红队测试逐步发现不安全的失效模式。我们进一步集成了独立的长期记忆模块,保存辩论交互中与安全相关的见解,并在后续推理中利用它们,促进模型行为的持续细化。实证评估在广泛的安全基准上进行,针对多种模型显示,RedDebate 在显著减少不安全输出方面取得显著效果。尽管辩论alone 允许 LLM 细化其行为,加入记忆后进一步显著降低了不安全输出。据我们了解,RedDebate 是首个将多智能体辩论和红队测试统一以无需人工干预的方式持续增强 LLM 安全性的完全自动化框架。
引用
@article{arxiv.2506.11083,
title = {RedDebate: Safer Responses through Multi-Agent Red Teaming Debates},
author = {Ali Asad and Stephen Obadinma and Radin Shayanfar and Xiaodan Zhu},
journal= {arXiv preprint arXiv:2506.11083},
year = {2025}
}