中文

利用注意力多智能体 DDPG 建模队友的动态联合策略

机器学习 2018-11-20 v1 人工智能 多智能体系统 机器学习

摘要

在合作多智能体系统中建模并利用队友策略一直是强化学习(RL)领域长期关注也是一个重大挑战的问题。其关注点在于:若智能体知晓队友策略,便可相应调整自身策略以达成恰当合作;而挑战在于,由于智能体并发学习,其策略持续变化,这给准确建模队友的动态策略带来困难。本文提出 ATTention Multi-Agent Deep Deterministic Policy Gradient(ATT-MADDPG)以应对该挑战。ATT-MADDPG 扩展了单智能体 actor-critic 强化学习方法 DDPG,并作了两项特殊设计。首先,为建模队友策略,智能体应获取队友的观测与动作。ATT-MADDPG 采用集中式 critic 来收集此类信息。其次,为利用所收集信息有效建模队友策略,ATT-MADDPG 为集中式 critic 增强了注意力机制。该注意力机制引入一种特殊结构以显式建模队友的动态联合策略,确保所收集信息能被高效处理。我们在基准任务与真实世界数据包路由任务上评估了 ATT-MADDPG。实验结果表明,它不仅大幅优于最先进的基于 RL 的方法与基于规则的方法,而且在可扩展性与鲁棒性方面取得更好性能。

关键词

引用

@article{arxiv.1811.07029,
  title  = {Modelling the Dynamic Joint Policy of Teammates with Attention Multi-agent DDPG},
  author = {Hangyu Mao and Zhengchao Zhang and Zhen Xiao and Zhibo Gong},
  journal= {arXiv preprint arXiv:1811.07029},
  year   = {2018}
}

备注

Attention-based Multi-agent DDPG. Experimental results show that it not only outperforms the state-of-the-art RL-based methods and rule-based methods by a large margin, but also achieves better performance in terms of scalability and robustness