中文

面向离线多智能体强化学习的反事实保守 Q 学习

人工智能 2023-09-25 v1

摘要

离线多智能体强化学习具有挑战性,其原因在于离线设定中常见的分布偏移问题以及多智能体设定中常见的高维问题二者的耦合效应,使得动作分布外(out-of-distribution, OOD)和值高估现象尤为严重。为缓解该问题,我们提出了一种新颖的多智能体离线强化学习算法,称为反事实保守 Q 学习(CounterFactual Conservative Q-Learning, CFCQL),以进行保守值估计。CFCQL 并非将所有智能体视为一个高维单体并直接对其应用单智能体方法,而是以反事实方式分别为每个智能体计算保守正则项,再将其线性组合以实现整体的保守值估计。我们证明,它仍享有与单智能体保守方法相同的低估性质与性能保证,但其导出的正则项与安全策略改进界与智能体数量无关,因此在理论上优于上述直接处理方式,尤其在智能体数量较大时。我们进一步在四个环境(包括离散与连续动作设定,基于现有及我们自建的数据集)上开展实验,表明 CFCQL 在大多数数据集上优于现有方法,且在其中部分数据集上优势显著。

关键词

引用

@article{arxiv.2309.12696,
  title  = {Counterfactual Conservative Q Learning for Offline Multi-agent Reinforcement Learning},
  author = {Jianzhun Shao and Yun Qu and Chen Chen and Hongchang Zhang and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2309.12696},
  year   = {2023}
}

备注

37th Conference on Neural Information Processing Systems (NeurIPS 2023)