具有隐式全局到局部价值正则化的离线多智能体强化学习
机器学习
2023-11-08 v2 多智能体系统
摘要
离线强化学习(RL)因能从离线数据集学习策略而无需环境交互,近年来备受关注。尽管在单智能体设定中取得一定成功,离线多智能体 RL(MARL)仍具挑战。巨大的联合状态-动作空间与耦合的多智能体行为为离线策略优化带来额外复杂性。多数现有离线 MARL 研究仅对个体智能体施加离线数据相关正则化,未充分考虑全局层面的多智能体系统。本文中,我们提出 OMIGA,一种具有隐式全局到局部价值正则化的新型离线多智能体 RL 算法。OMIGA 提供将全局层面价值正则化转化为等价隐式局部价值正则化并同时实现样本内学习的原理性框架,从而优雅地桥接多智能体价值分解与带离线正则化的策略学习。基于离线多智能体 MuJoCo 与 StarCraft II 微操任务的全面实验,我们表明 OMIGA 在几乎所有任务上均优于最先进离线 MARL 方法。
引用
@article{arxiv.2307.11620,
title = {Offline Multi-Agent Reinforcement Learning with Implicit Global-to-Local Value Regularization},
author = {Xiangsen Wang and Haoran Xu and Yinan Zheng and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2307.11620},
year = {2023}
}
备注
Accepted by the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)