多智能体强化学习中对抗性通信的涌现
机器人学
2020-11-05 v2 人工智能
机器学习
多智能体系统
摘要
许多现实世界问题需要多个自主智能体的协调。近期工作展示了图神经网络(GNNs)在学习显式通信策略以实现复杂多智能体协调方面的潜力。这些工作采用合作型多智能体系统模型,其中智能体力求实现共享的全局目标。当考虑具有利己局部目标的智能体时,标准设计选择是将它们建模为独立的学习系统(尽管共享同一环境)。然而,这种设计选择排除了单一可微分通信信道的存在,从而禁止了智能体间通信策略的学习。在本工作中,我们填补了这一空白,提出一种学习模型,该模型兼顾个体非共享奖励以及所有智能体共有的可微分通信信道。我们聚焦于智能体具有利己目标的情形,并开发了一种学习算法,可诱导出对抗性通信的涌现。我们在多智能体覆盖与路径规划问题上进行了实验,并采用事后可解释性技术来可视化智能体彼此通信的消息。我们展示了一个单一的利己智能体如何能够学习高度操纵性的通信策略,从而显著优于合作型智能体团队。
引用
@article{arxiv.2008.02616,
title = {The Emergence of Adversarial Communication in Multi-Agent Reinforcement Learning},
author = {Jan Blumenkamp and Amanda Prorok},
journal= {arXiv preprint arXiv:2008.02616},
year = {2020}
}
备注
Accepted to Conference on Robot Learning (CoRL) 2020. Camera-ready version incorporating rebuttal