中文

眼见为实:面向离线多智能体强化学习的隐式约束方法

人工智能 2021-10-27 v2

摘要

从数据集学习且不与环境交互(离线学习)是将强化学习(RL)算法应用于真实场景的关键一步。然而,相较于单智能体情形,离线多智能体 RL 引入了更多智能体及更大的状态与动作空间,更具挑战性却鲜受关注。我们论证了当前离线 RL 算法因外推误差的累积而在多智能体系统中失效。本文提出一种新颖的离线 RL 算法,称为隐式约束 Q 学习(ICQ),其通过仅信任数据集中给出的状态-动作对进行价值估计,有效缓解外推误差。此外,我们在隐式约束下分解联合策略,将 ICQ 扩展至多智能体任务。实验结果表明,外推误差被成功控制在合理范围内且对智能体数量不敏感。我们进一步展示 ICQ 在具挑战性的多智能体离线任务(StarCraft II)中达到了最先进(SOTA)性能。我们的代码公开于 https://github.com/YiqinYang/ICQ。

关键词

引用

@article{arxiv.2106.03400,
  title  = {Believe What You See: Implicit Constraint Approach for Offline Multi-Agent Reinforcement Learning},
  author = {Yiqin Yang and Xiaoteng Ma and Chenghao Li and Zewu Zheng and Qiyuan Zhang and Gao Huang and Jun Yang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2106.03400},
  year   = {2021}
}

备注

Accepted by NeurIPS2021. The first two authors contributed equally to the work