中文

大规模多智能体合作与竞争任务中通信时机的学

机器学习 2018-12-27 v1 人工智能 多智能体系统 机器学习

摘要

在多智能体任务中,学习何时通信并有效进行通信至关重要。近期的研究表明,连续通信可在多智能体场景中通过反向传播实现高效训练,但仅限于完全合作任务。本文提出个性化受控连续通信模型(IC3Net),其训练效率优于简单连续通信模型,并可应用于半合作、竞争以及合作场景。IC3Net 通过门控机制控制连续通信,并为每个智能体使用个性化奖励,从而在解决信用分配问题的同时获得更好的性能与可扩展性。利用包括星际争霸母巢之战探索与战斗场景在内的多种任务,我们表明随着规模增大,我们的网络相较基线取得了更优的性能与收敛速度。我们的结果表明,IC3Net 智能体能够根据场景与收益性学习何时通信。

关键词

引用

@article{arxiv.1812.09755,
  title  = {Learning when to Communicate at Scale in Multiagent Cooperative and Competitive Tasks},
  author = {Amanpreet Singh and Tushar Jain and Sainbayar Sukhbaatar},
  journal= {arXiv preprint arXiv:1812.09755},
  year   = {2018}
}

备注

Accepted to ICLR 2019