大规模多智能体合作与竞争任务中通信时机的学
机器学习
2018-12-27 v1 人工智能
多智能体系统
机器学习
摘要
在多智能体任务中,学习何时通信并有效进行通信至关重要。近期的研究表明,连续通信可在多智能体场景中通过反向传播实现高效训练,但仅限于完全合作任务。本文提出个性化受控连续通信模型(IC3Net),其训练效率优于简单连续通信模型,并可应用于半合作、竞争以及合作场景。IC3Net 通过门控机制控制连续通信,并为每个智能体使用个性化奖励,从而在解决信用分配问题的同时获得更好的性能与可扩展性。利用包括星际争霸母巢之战探索与战斗场景在内的多种任务,我们表明随着规模增大,我们的网络相较基线取得了更优的性能与收敛速度。我们的结果表明,IC3Net 智能体能够根据场景与收益性学习何时通信。
引用
@article{arxiv.1812.09755,
title = {Learning when to Communicate at Scale in Multiagent Cooperative and Competitive Tasks},
author = {Amanpreet Singh and Tushar Jain and Sainbayar Sukhbaatar},
journal= {arXiv preprint arXiv:1812.09755},
year = {2018}
}
备注
Accepted to ICLR 2019