面向多智能体强化学习的基于状态的情景记忆
机器学习
2021-10-20 v1 人工智能
多智能体系统
摘要
多智能体强化学习(MARL)算法近年来通过利用集中训练与分散执行(CTDE)范式取得了可喜进展。然而,现有 MARL 算法仍受样本低效问题困扰。在本文中,我们提出一种简单而有效的方法,称为基于状态的情景记忆(SEM),以提升 MARL 中的样本效率。SEM 采用情景记忆(EM)来监督 MARL 中 CTDE 的集中训练过程。据我们所知,SEM 是将 EM 引入 MARL 的首项工作。我们可从理论上证明,当用于 MARL 时,SEM 比最初为单智能体强化学习提出的基于状态与动作的 EM(SAEM)具有更低的空间复杂度和时间复杂度。在星际争霸多智能体挑战(SMAC)上的实验结果表明,将情景记忆引入 MARL 可提升样本效率,且相较于 SAEM,SEM 能够降低存储成本与时间成本。
引用
@article{arxiv.2110.09817,
title = {State-based Episodic Memory for Multi-Agent Reinforcement Learning},
author = {Xiao Ma and Wu-Jun Li},
journal= {arXiv preprint arXiv:2110.09817},
year = {2021}
}