基于 Gumbel Sinkhorn 网络学习的图强化学习潜在排列预见
机器学习
2021-10-26 v1 人工智能
摘要
在多智能体环境中,合作具有至关重要的必要性,因此已有一些结合图神经网络的强化学习算法被提出,以理解智能体之间的相互作用。然而,高度复杂且动态的多智能体环境需要更精巧的图神经网络,其不仅能全面表示图拓扑结构,还能表示由于智能体出现、消失和移动所导致的结构演化过程。为应对这些困难,我们提出 Gumbel Sinkhorn 图注意力强化学习,其中图注意力网络高度表征多智能体环境的底层图拓扑结构,并借助 Gumbel Sinkhorn 网络通过学习潜在排列更好地适应图的动态拓扑结构。经验上,仿真结果表明,在 PettingZoo 多智能体环境中,我们所提出的图强化学习方法通过学习潜在排列优于现有方法。
引用
@article{arxiv.2110.12144,
title = {Foresight of Graph Reinforcement Learning Latent Permutations Learnt by Gumbel Sinkhorn Network},
author = {Tianqi Shen and Hong Zhang and Ding Yuan and Jiaping Xiao and Yifan Yang},
journal= {arXiv preprint arXiv:2110.12144},
year = {2021}
}