眼见为实:面向离线多智能体强化学习的隐式约束方法
人工智能
2021-10-27 v2
摘要
从数据集学习且不与环境交互(离线学习)是将强化学习(RL)算法应用于真实场景的关键一步。然而,相较于单智能体情形,离线多智能体 RL 引入了更多智能体及更大的状态与动作空间,更具挑战性却鲜受关注。我们论证了当前离线 RL 算法因外推误差的累积而在多智能体系统中失效。本文提出一种新颖的离线 RL 算法,称为隐式约束 Q 学习(ICQ),其通过仅信任数据集中给出的状态-动作对进行价值估计,有效缓解外推误差。此外,我们在隐式约束下分解联合策略,将 ICQ 扩展至多智能体任务。实验结果表明,外推误差被成功控制在合理范围内且对智能体数量不敏感。我们进一步展示 ICQ 在具挑战性的多智能体离线任务(StarCraft II)中达到了最先进(SOTA)性能。我们的代码公开于 https://github.com/YiqinYang/ICQ。
引用
@article{arxiv.2106.03400,
title = {Believe What You See: Implicit Constraint Approach for Offline Multi-Agent Reinforcement Learning},
author = {Yiqin Yang and Xiaoteng Ma and Chenghao Li and Zewu Zheng and Qiyuan Zhang and Gao Huang and Jun Yang and Qianchuan Zhao},
journal= {arXiv preprint arXiv:2106.03400},
year = {2021}
}
备注
Accepted by NeurIPS2021. The first two authors contributed equally to the work