通过过程奖励扩展多主体系统
人工智能
2026-02-05 v2 计算与语言
新兴技术
多智能体系统
摘要
虽然多主体系统已展现出通过专业化来解决复杂任务的潜力,但同时调谐多个主体面临两个关键挑战:(1) 主体间的信用分配,(2) 高成本多主体滚动的样本效率。在本工作中,我们提出一种通过来自 AI 反馈的 per-action process rewards 来调谋多主体系统的方案,即 MAPPA,以解决上述两个问题。通过将信用分配到单个主体动作上而非仅在任务完成时,MAPPA 实现了无需 ground truth 标签的精细监督,同时从每个滚动过程中提取最大训练信号。我们在竞赛数学问题和工具增强数据分析任务上展示了该方法。在未见的 mathematics 题目上,MAPPA 在 AIME 和 AMC 上的准确率提升了 +5.0--17.5pp 和 +7.8--17.2pp。在数据分析任务中,该方法使成功率提升 +16.7pp,质量指标提升最高可达 47%,验证了按动作分配信用可在不同主体系统中带来改进。通过解决这些挑战,本工作迈出了 scaling 多主体系统以应对复杂、长期 horizon 任务、并实现最小人类监督的第一步。
引用
@article{arxiv.2601.23228,
title = {Scaling Multiagent Systems with Process Rewards},
author = {Ed Li and Junyu Ren and Cat Yan},
journal= {arXiv preprint arXiv:2601.23228},
year = {2026}
}