中文

MetaAgent-X:通过端到端强化学习打破自动多智能体系统的天花板

人工智能 2026-05-15 v1

摘要

自动多智能体系统旨在无需依赖人工设计或固定编排的情况下实例化智能体工作流。然而,现有的自动 MAS 方法仅保持部分自适应:它们要么执行无需训练的测试时搜索,要么在保持下游执行智能体冻结的同时优化元级设计器,这造成了一个“冻结执行器”天花板,使得自设计与自执行的智能体模型的端到端训练未被探索。为解决此问题,我们引入了 MetaAgent-X,一个联合优化自动 MAS 设计与执行的端到端强化学习框架。MetaAgent-X 支持基于脚本的 MAS 生成、执行 rollout 收集,以及针对设计器和执行器轨迹的信用分配。为支持稳定且可规模化的优化,我们提出了执行器设计器分层 rollout 和分阶段协同进化,以改善训练稳定性并揭示设计器与执行器协同进化的动态。MetaAgent-X 始终优于现有的自动 MAS 基线,取得了高达 21.7% 的增益。全面的消融实验表明,设计器和执行器在训练过程中均有改进,且有效的自动 MAS 学习遵循分阶段协同进化过程。这些结果将端到端可训练的自动 MAS 确立为构建自设计与自执行智能体模型的实用范式。

关键词

引用

@article{arxiv.2605.14212,
  title  = {MetaAgent-X : Breaking the Ceiling of Automatic Multi-Agent Systems via End-to-End Reinforcement Learning},
  author = {Yaolun Zhang and Yujie Zhao and Nan Wang and Yiran Wu and Jiayu Chang and Yizhao Chen and Qingyun Wu and Jishen Zhao and Huazheng Wang},
  journal= {arXiv preprint arXiv:2605.14212},
  year   = {2026}
}