中文

AgentBreeder:通过自我改进缓解多智能体框架的AI安全风险

密码学与安全 2025-10-15 v4 人工智能 神经与进化计算

摘要

将大型语言模型(LLMs)搭建为多智能体系统通常能提高其在复杂任务上的性能,但此类框架的安全影响尚未得到充分探索。我们引入了 AgentBreeder,一个用于对框架进行多目标自我改进进化搜索的框架。我们在广泛认可的推理、数学和安全基准上评估了发现的框架,并将其与流行的基线进行比较。在“蓝队”模式下,我们观察到安全基准性能平均提升 79.4%,同时保持或提高了能力得分。在“红队”模式下,我们发现对抗性弱框架与能力优化同时出现。我们的工作展示了多智能体框架的风险,并提供了一个缓解这些风险的框架。代码可在 https://github.com/jrosseruk/AgentBreeder 获取。

关键词

引用

@article{arxiv.2502.00757,
  title  = {AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement},
  author = {J Rosser and Jakob Foerster},
  journal= {arXiv preprint arXiv:2502.00757},
  year   = {2025}
}