中文

多智能体深度研究:使用M-GRPO训练多智能体系统

组合数学 2025-11-18 v1 数学物理 math.MP 概率论

摘要

多智能体系统在通用推理任务中表现良好,但缺乏针对特定领域的训练导致准确率受限。当前训练方法为系统中的所有智能体统一训练一个大语言模型(LLM),可能受制于不同智能体 underlying的分布差异。因此,使用具有不同LLM的智能体进行训练是下一步解决方法,但该方法引入了优化挑战。例如,智能体 operates at different frequencies,rollouts涉及可变数量的子智能体调用,且智能体常部署在separate servers上,破坏端到端梯度流。为此,我们提出M-GRPO,这是一种为垂直多智能体系统设计的Group Relative Policy Optimization的层次性扩展,包含主智能体(计划者)和多个子智能体(多轮工具执行者)。M-GRPO为主智能体和子智能体计算group-relative advantages,维持层次化信用分配。它还引入一种trajectory-alignment方案,使batch size固定 despite variable sub-agent invocations。我们部署了解耦的训练管道,使智能体在separate servers上运行并通过共享存储交换最小统计数据。这实现了可扩展的训练,无需跨服务器反向传播。在GAIA、XBench-DeepSearch和WebWalkerQA等真实世界基准测试中,M-GRPO持续优于单智能体GRPO和使用冻结子智能体的多智能体GRPO,显示出更好的稳定性和样本效率。这些结果表明,对齐异构轨迹并在专门化智能体之间解耦优化,提高了工具增强推理任务的表现。

关键词

引用

@article{arxiv.2511.13287,
  title  = {Counting words without strictly increasing subwords of fixed length},
  author = {Senan Sekhon},
  journal= {arXiv preprint arXiv:2511.13287},
  year   = {2025}
}

备注

17 pages