重新审视 MADDPG 中的 Gumbel-Softmax
机器学习
2023-06-16 v2 人工智能
多智能体系统
机器学习
摘要
MADDPG 是多智能体强化学习(MARL)中的一种算法,它将流行的单智能体方法 DDPG 扩展到多智能体场景。重要的是,DDPG 是为连续动作空间设计的算法,其状态-动作值函数的梯度存在。为使该算法在离散动作空间中工作,必须进行离散梯度估计。对于 MADDPG,使用了 Gumbel-Softmax(GS)估计器——一种将离散分布松弛为相似连续分布的重参数化方法。然而,该方法存在统计偏差,最近一篇 MARL 基准测试论文指出,这种偏差使得 MADDPG 在动作空间离散的网格世界情形下表现不佳。幸运的是,存在许多 GS 的替代方案,具有广泛的特性。本文探讨了其中几种替代方案,并将其集成到 MADDPG 中用于离散网格世界场景。随后测量并分析了其对各种性能指标的影响。研究发现,所提出的估计器之一在多个任务中显著优于原始 GS,回报最高提升 55%,且收敛更快。
引用
@article{arxiv.2302.11793,
title = {Revisiting the Gumbel-Softmax in MADDPG},
author = {Callum Rhys Tilbury and Filippos Christianos and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2302.11793},
year = {2023}
}
备注
Presented at AAMAS Workshop on Adaptive and Learning Agents, 2023