SrSv: 将顺序推演与顺序价值估计集成用于多智能体强化学习
人工智能
2025-03-04 v1 机器学习
多智能体系统
摘要
尽管多智能体强化学习 (MARL) 在各个领域显示出成功,但将其应用到大型真实系统仍面临重大挑战。主要是,真实环境的高复杂度加剧了信用分配问题,显著降低了训练效率。此外,大规模场景中智能体 populations 的可变性 necessitates 可扩展的决策机制。为此,我们提出了一种新框架:Sequential rollout with Sequential value estimation (SrSv)。该框架旨在捕获智能体之间的相互作用,并为合作 MARL 提供可扩展的解决方案。具体而言,SrSv 利用 Transformer 模型的自回归特性来处理可变 populations 的顺序动作推演。此外,为了捕获多个智能体之间策略分布和价值函数的相互作用,我们引入了一种创新的顺序价值估计方法,并将价值近似集成到注意力机制的顺序模型中。我们在三个基准测试中评估了 SrSv:Multi-Agent MuJoCo、StarCraft Multi-Agent Challenge 和 DubinsCars。实验结果表明,SrSv 在训练效率方面显著优于基线方法,同时不损害收敛性能。此外,当在具有 1,024 个智能体的大型 DubinsCar 系统中实现时,我们的框架超越了现有基准,凸显了 SrSv 的优异可扩展性。
关键词
引用
@article{arxiv.2503.01458,
title = {SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning},
author = {Xu Wan and Chao Yang and Cheng Yang and Jie Song and Mingyang Sun},
journal= {arXiv preprint arXiv:2503.01458},
year = {2025}
}