中文

基于最大熵的混合动作空间深度多智能体强化学习

机器学习 2022-06-13 v1 人工智能

摘要

多智能体深度强化学习已被用于解决具有离散或连续动作空间的多种复杂问题并取得巨大成功。然而,大多数真实环境不能仅由离散动作空间或仅由连续动作空间描述。且鲜有工作曾将深度强化学习(drl)用于具有混合动作空间的多智能体问题。因此,我们提出一种新算法:深度多智能体混合软演员-评论家(MAHSAC)以填补此空白。该算法遵循集中训练分散执行(CTDE)范式,并基于最大熵将软演员-评论家算法(SAC)扩展至处理多智能体环境中的混合动作空间问题。我们的实验运行于一个具有连续观测与离散动作空间以及若干基础模拟物理的简易多智能体粒子世界。实验结果表明,MAHSAC在训练速度、稳定性与抗干扰能力方面具有良好表现。同时,在合作与竞争场景中均优于现有的独立深度混合学习方法。

关键词

引用

@article{arxiv.2206.05108,
  title  = {Deep Multi-Agent Reinforcement Learning with Hybrid Action Spaces based on Maximum Entropy},
  author = {Hongzhi Hua and Kaigui Wu and Guixuan Wen},
  journal= {arXiv preprint arXiv:2206.05108},
  year   = {2022}
}