更高的重放比率赋能样本高效的多智能体强化学习
机器学习
2024-04-16 v1 人工智能
多智能体系统
摘要
强化学习 (RL) 的一个著名问题是样本效率低下。与单智能体 RL 相比,多智能体强化学习 (MARL) 的样本效率面临更大挑战,这源于其固有的部分可观测性、非平稳训练以及庞大的策略空间。尽管已有大量努力致力于开发新方法并提升样本效率,我们着眼于广泛使用的回合制训练机制。在每个训练步骤中,收集了数十帧数据,却仅进行一次梯度更新。我们认为这种回合制训练可能是导致样本效率低下的原因。为了更好地利用已收集的数据,我们提议提高每次环境交互的梯度更新频率(亦称重放比率或更新数据比)。为了展示其通用性,我们在 6 个 SMAC 任务上评估了 3 种 MARL 方法。实验结果验证了更高的重放比率能显著提升 MARL 算法的样本效率。本文用于复现结果的代码已在 https://anonymous.4open.science/r/rr_for_MARL-0D83/ 开源。
引用
@article{arxiv.2404.09715,
title = {Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning},
author = {Linjie Xu and Zichuan Liu and Alexander Dockhorn and Diego Perez-Liebana and Jinyu Wang and Lei Song and Jiang Bian},
journal= {arXiv preprint arXiv:2404.09715},
year = {2024}
}