多智能体强化学习中的廉价交谈发现与利用
人工智能
2023-03-21 v1 多智能体系统
摘要
通过使智能体能够通信,近期的协作多智能体强化学习(MARL)方法已展现出更优的任务表现与更协调的行为。大多数现有方法通过允许智能体经由自由通信信道(即廉价交谈信道)互相发送消息来促进智能体间通信。当前方法要求这些信道始终可访问且为智能体先验所知。在本文工作中,我们解除这些要求,使智能体必须发现廉价交谈信道并学习如何使用它们。因此,该问题包含两主要部分:廉价交谈发现(CTD)与廉价交谈利用(CTU)。我们为两部分引入了一种新颖的概念框架,并基于互信息最大化开发了新算法,在 CTD/CTU 设定下优于已有算法。我们还发布了一套新颖基准套件以激励 CTD/CTU 的未来研究。
引用
@article{arxiv.2303.10733,
title = {Cheap Talk Discovery and Utilization in Multi-Agent Reinforcement Learning},
author = {Yat Long Lo and Christian Schroeder de Witt and Samuel Sokota and Jakob Nicolaus Foerster and Shimon Whiteson},
journal= {arXiv preprint arXiv:2303.10733},
year = {2023}
}
备注
The 11th International Conference on Learning Representations (ICLR)