中文

面向在线与离线多智能体强化学习的自监督信息聚合高效通信

机器学习 2023-02-21 v1 多智能体系统

摘要

利用来自队友的消息可以改善协作式多智能体强化学习中的协调。以往的工作通常将队友的原始消息与局部信息结合作为策略的输入。然而,忽略消息聚合会导致策略学习的效率显著低下。受表示学习最新进展的启发,我们认为高效的消息聚合对于协作式多智能体强化学习中的良好协调至关重要。在本文中,我们提出了基于自监督信息聚合的多智能体通信方法,其中智能体可以将接收到的消息聚合成具有高相关性的紧凑表示,以增强局部策略。具体来说,我们设计了一个置换不变的消息编码器,从消息中生成共同的信息聚合表示,并通过自监督方式重建和预测未来信息来优化它。因此,每个智能体将通过一种新颖的消息提取机制,利用聚合表示中最相关的部分进行决策。此外,考虑到离线学习在现实世界应用中的潜力,我们为多智能体通信构建了离线基准,据我们所知这是首次。实证结果证明了我们的方法在在线和离线设置中的优越性。我们还发布了本文中构建的离线基准,作为通信能力验证的测试平台,以促进未来的进一步研究。

关键词

引用

@article{arxiv.2302.09605,
  title  = {Efficient Communication via Self-supervised Information Aggregation for Online and Offline Multi-agent Reinforcement Learning},
  author = {Cong Guan and Feng Chen and Lei Yuan and Zongzhang Zhang and Yang Yu},
  journal= {arXiv preprint arXiv:2302.09605},
  year   = {2023}
}