基于分层循环神经网络的Transformer MADDPG用于混合合作-竞争环境
机器学习
2021-05-12 v1 多智能体系统
摘要
目前,注意力机制已广泛应用于深度学习模型领域。基于注意力机制的结构模型不仅能够记录特征位置之间的关系,还能根据特征的权重衡量不同特征的重要性。通过建立动态加权参数以选择相关与不相关特征,可增强关键信息并削弱无关信息。因此,深度学习算法的效率可得到显著提升与改善。尽管Transformer在许多领域(包括强化学习)中表现优异,但该领域内仍有许多问题与应用可借助Transformer加以解决与构建。MARL(即多智能体强化学习,Multi-Agent Reinforcement Learning)可被视为一组独立智能体试图通过自身方式适应与学习以达成目标。为强调某一时间段内各MDP决策之间的关系,我们采用了分层编码方法并验证了该方法的有效性。本文提出了一种基于RNN的分层Transformer MADDPG,称之为Hierarchical RNNs-Based Transformers MADDPG(HRTMADDPG)。其由一个基于RNN的下层编码器(对每个时间序列中的多步长进行编码)以及一个基于Transformer的上层序列级编码器(用于学习多个序列间的相关性,从而捕捉子时间序列间的因果关系并使HRTMADDPG更高效)组成。
引用
@article{arxiv.2105.04888,
title = {Hierarchical RNNs-Based Transformers MADDPG for Mixed Cooperative-Competitive Environments},
author = {Xiaolong Wei and LiFang Yang and Xianglin Huang and Gang Cao and Tao Zhulin and Zhengyang Du and Jing An},
journal= {arXiv preprint arXiv:2105.04888},
year = {2021}
}
备注
10 pages