基于异构分组强化学习的LLM驱动多智能体搜索系统端到端优化
机器学习
2026-04-21 v2 人工智能
摘要
大型语言模型(LLM)用途广泛,但由于静态知识截断以及在单次推理中难以产生可控行为,其在复杂现实环境中的部署受到限制。多智能体搜索系统(MASS)通过协调配备搜索工具的专用LLM智能体,利用任务分解和检索增强问题解决来缓解这些问题。然而,通过提示工程或监督微调来优化特定智能体角色的LLM仍然费时费力,这促使了自动化的端到端训练。现有的多智能体强化学习(MARL)方法,如多智能体近端策略优化(MAPPO),通常依赖大型评论家网络来评估联合动作,导致不稳定性和高内存开销。我们引入了多智能体异构分组策略优化(MHGPO),该方法通过估计多智能体轨迹的异构组之间的相对优势来更新策略,将优化重点从局部智能体性能转移到全局系统成功上。我们进一步研究了三种分组轨迹采样策略,以在样本效率和优化质量之间进行权衡。实验表明,MHGPO捕获了隐式的智能体间依赖关系,并在任务性能和计算效率上均始终优于强基线。
引用
@article{arxiv.2506.02718,
title = {End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning},
author = {Guanzhong Chen and Shaoxiong Yang and Chao Li and Wei Liu and Jian Luan and Zenglin Xu},
journal= {arXiv preprint arXiv:2506.02718},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference. 20 pages, 9 figures