通过信用重新分配实现语言多智能体学习在交互式环境中的泛化
计算与语言
2025-08-21 v3
摘要
基于大语言模型(LLM)的智能体在交互式环境中(如移动操作和网页浏览等)取得了显著进展。当前多智能体系统在性能上优于单一智能体,但由于角色预定义不足以及缺乏有效的语言智能体泛化策略,导致跨环境泛化能力不足。实现同时具备强大性能和良好泛化能力的挑战,一直是制约多智能体系统在交互式环境中发展的瓶颈。为此,我们提出了 CollabUIAgents,一种基于多智能体强化学习框架的新方法,引入 novel 多智能体信用重新分配(Credit Re-assignment, CR)策略,采用 LLMs 分配奖励而非环境特定奖励,并通过合成偏好数据进行学习,以培育角色自由智能体策略间的可泛化、协作行为。实证结果表明,我们的框架显著提升了多智能体系统的性能和跨环境泛化能力。我们的 7B 参数系统在性能上与或超过许多闭源模型,LLM 作为 CR 的指导者也发挥了重要作用。我们还提供了在环境泛化中有效利用细粒度 CR 奖励以及在多智能体系统中集成训练好的 LLMs 的见解。
引用
@article{arxiv.2502.14496,
title = {Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization},
author = {Zhitao He and Zijun Liu and Peng Li and Yi R. Fung and Ming Yan and Ji Zhang and Fei Huang and Yang Liu},
journal= {arXiv preprint arXiv:2502.14496},
year = {2025}
}
备注
Published in COLM2025