多智能体强化学习通信学习中离散化方法的分析
机器学习
2022-04-13 v1 多智能体系统
摘要
当智能体无法观测环境完整状态时,通信在多智能体强化学习中至关重要。允许智能体间进行学习化通信的最常见方法是使用可微通信信道,使梯度作为反馈形式在智能体间流动。然而,当我们希望使用离散消息来减小消息尺寸时,这具有挑战性,因为梯度无法流经离散通信信道。已有工作提出了处理该问题的方法。但这些方法在不同的通信学习架构与环境中测试,难以相互比较。本文比较了若干最先进的离散化方法以及两种此前未用于通信学习的方法。我们在利用来自其他智能体的梯度进行通信学习的背景下进行此比较,并在若干环境中进行测试。结果表明,没有一种方法在所有环境中都是最优的。离散化方法的最佳选择极大依赖于环境。然而,离散正则化单元(DRU)、直通 DRU 与直通 Gumbel softmax 在所有测试环境中表现出最一致的结果。因此,这些方法被证明是通用使用的最佳选择,而直通估计器与 Gumbel softmax 可能在特定环境中提供更好结果,但在其他环境中完全失效。
引用
@article{arxiv.2204.05669,
title = {An Analysis of Discretization Methods for Communication Learning with Multi-Agent Reinforcement Learning},
author = {Astrid Vanneste and Simon Vanneste and Kevin Mets and Tom De Schepper and Siegfried Mercelis and Steven Latré and Peter Hellinckx},
journal= {arXiv preprint arXiv:2204.05669},
year = {2022}
}
备注
Accepted at Adaptive and Learning Agents Workshop (ALA 2022) https://ala2022.github.io/