中文

消息丢弃:一种用于多智能体深度强化学习的高效训练方法

机器学习 2019-02-19 v1 人工智能 多智能体系统

摘要

在本文中,我们提出了一种名为消息丢弃(message-dropout)的新学习技术,以在两种应用场景下提升多智能体深度强化学习的性能:1)允许智能体间直接消息通信的经典多智能体强化学习;2)集中训练分散执行。在第一种允许智能体间直接消息通信的多智能体系统应用场景中,消息丢弃技术在训练阶段以一定概率以块方式丢弃来自其他智能体的接收消息,并通过将丢弃块单元的权重乘以修正概率来补偿该效应。所应用的消息丢弃技术有效处理了带通信的多智能体强化学习中增加的输入维度,并使学习在执行阶段对通信错误具有鲁棒性。在第二种集中训练分散执行的应用场景中,我们特别考虑将所提出的消息丢弃应用于多智能体深度确定性策略梯度(MADDPG),其使用集中评论家训练每个智能体的分散执行者。我们在多个游戏上评估了所提出的消息丢弃技术,数值结果表明,具有适当丢弃率的消息丢弃技术在训练速度和执行阶段稳态性能方面显著改善了强化学习性能。

关键词

引用

@article{arxiv.1902.06527,
  title  = {Message-Dropout: An Efficient Training Method for Multi-Agent Deep Reinforcement Learning},
  author = {Woojun Kim and Myungsik Cho and Youngchul Sung},
  journal= {arXiv preprint arXiv:1902.06527},
  year   = {2019}
}

备注

The 33rd AAAI Conference on Artificial Intelligence (AAAI) 2019