ComaDICE:基于 stationary 分布迁移正则化的离线协作多智能体强化学习
机器学习
2024-10-04 v1 多智能体系统
摘要
离线强化学习(RL)因能够从预收集的数据集中学习有效策略而引起广泛关注,无需进一步的环境交互。在单智能体设置下已展示了有前景的结果,但离线多智能体强化学习(MARL)面临额外挑战,包括大型联合状态-动作空间和复杂的多智能体行为。离线 RL 的一个关键问题是分布迁移,当优化的目标策略偏离生成数据的行为策略时就会发生。这种问题在 MARL 中因智能体局部策略之间的相互依赖以及庞大的联合状态-动作空间而加剧。以往方法主要通过在 Q 函数或策略的空间中加入正则化来解决此挑战。本文在 stationary 分布空间中引入正则化,以更好地处理分布迁移。我们的算法 ComaDICE 通过为全局学习策略纳入 stationary 分布正则化,配合精心构建的多智能体价值分解策略来促进多智能体训练。通过在多智能体 MuJoCo 和 StarCraft II 基准测试上的大量实验,我们展示了 ComaDICE 在 nearly all 任务上相对于最先进的离线 MARL 方法实现了卓越的性能。
引用
@article{arxiv.2410.01954,
title = {ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization},
author = {The Viet Bui and Thanh Hong Nguyen and Tien Mai},
journal= {arXiv preprint arXiv:2410.01954},
year = {2024}
}