中文

超越保守性:离线多智能体强化学习中的扩散策略

人工智能 2023-07-06 v1 机器学习 多智能体系统

摘要

我们提出了一种用于离线多智能体强化学习(MARL)的新型扩散离线多智能体模型(DOM2)。与现有主要依赖策略设计中的保守性的算法不同,DOM2 基于扩散增强了策略的表达能力与多样性。具体而言,我们将扩散模型引入策略网络,并提出了一种训练中以轨迹为基础的数据增强方案。这些关键要素使我们的算法对环境变化更具鲁棒性,并在性能、泛化能力和数据效率上取得显著提升。我们广泛的实验结果表明,DOM2 在多智能体粒子和多智能体 MuJoCo 环境中优于现有的最先进方法,并且由于其高表达能力和多样性,在偏移环境中泛化能力显著更好。此外,DOM2 展现出优越的数据效率,与使用现有算法相比,可用少 20 倍以上的数据达到最先进的性能。

关键词

引用

@article{arxiv.2307.01472,
  title  = {Beyond Conservatism: Diffusion Policies in Offline Multi-agent Reinforcement Learning},
  author = {Zhuoran Li and Ling Pan and Longbo Huang},
  journal= {arXiv preprint arXiv:2307.01472},
  year   = {2023}
}