利用注意力多智能体 DDPG 建模队友的动态联合策略
机器学习
2018-11-20 v1 人工智能
多智能体系统
机器学习
摘要
在合作多智能体系统中建模并利用队友策略一直是强化学习(RL)领域长期关注也是一个重大挑战的问题。其关注点在于:若智能体知晓队友策略,便可相应调整自身策略以达成恰当合作;而挑战在于,由于智能体并发学习,其策略持续变化,这给准确建模队友的动态策略带来困难。本文提出 ATTention Multi-Agent Deep Deterministic Policy Gradient(ATT-MADDPG)以应对该挑战。ATT-MADDPG 扩展了单智能体 actor-critic 强化学习方法 DDPG,并作了两项特殊设计。首先,为建模队友策略,智能体应获取队友的观测与动作。ATT-MADDPG 采用集中式 critic 来收集此类信息。其次,为利用所收集信息有效建模队友策略,ATT-MADDPG 为集中式 critic 增强了注意力机制。该注意力机制引入一种特殊结构以显式建模队友的动态联合策略,确保所收集信息能被高效处理。我们在基准任务与真实世界数据包路由任务上评估了 ATT-MADDPG。实验结果表明,它不仅大幅优于最先进的基于 RL 的方法与基于规则的方法,而且在可扩展性与鲁棒性方面取得更好性能。
引用
@article{arxiv.1811.07029,
title = {Modelling the Dynamic Joint Policy of Teammates with Attention Multi-agent DDPG},
author = {Hangyu Mao and Zhengchao Zhang and Zhen Xiao and Zhibo Gong},
journal= {arXiv preprint arXiv:1811.07029},
year = {2018}
}
备注
Attention-based Multi-agent DDPG. Experimental results show that it not only outperforms the state-of-the-art RL-based methods and rule-based methods by a large margin, but also achieves better performance in terms of scalability and robustness