中文

基于多智能体强化学习反向传播通信学习中离散化方法的深入分析

机器学习 2023-08-10 v1 人工智能 多智能体系统

摘要

当智能体无法观测环境完整状态时,通信在多智能体强化学习中至关重要。允许智能体间学习通信的最常见方法是使用可微分通信信道,使梯度作为反馈形式在智能体间流动。然而,当我们希望使用离散消息以减小消息尺寸时,这具有挑战性,因为梯度无法流经离散通信信道。先前工作提出了处理该问题的方法,但这些方法在不同通信学习架构和环境中测试,难以比较。本文中,我们比较了若干最先进的离散化方法以及一种新方法。我们在利用来自其他智能体的梯度进行通信学习的背景下进行此比较,并在多个环境中进行测试。此外,我们提出 COMA-DIAL,一种基于 DIAL 和 COMA 并扩展学习率缩放与自适应探索的通信学习方法。使用 COMA-DIAL 使我们能在更复杂环境中进行实验。我们的结果表明,本文提出的新型 ST-DRU 方法在所有离散化方法中跨不同环境取得最佳结果。它在每项实验中均达到最佳或接近最佳性能,且是唯一在任一测试环境中均未失败的方法。

关键词

引用

@article{arxiv.2308.04938,
  title  = {An In-Depth Analysis of Discretization Methods for Communication Learning using Backpropagation with Multi-Agent Reinforcement Learning},
  author = {Astrid Vanneste and Simon Vanneste and Kevin Mets and Tom De Schepper and Siegfried Mercelis and Peter Hellinckx},
  journal= {arXiv preprint arXiv:2308.04938},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2204.05669