中文

协作多智能体强化学习中智能体间交互的建模

机器学习 2021-02-12 v1 人工智能

摘要

基于价值的多智能体强化学习(MARL)方法,尤其是价值分解方法,已在一系列具有挑战性的协作任务上得到验证。然而,当前方法很少关注智能体间的交互,而这对游戏或现实生活中的团队协作至关重要。这限制了基于价值的MARL算法在协作探索与价值函数估计两方面的效率。本文提出一种名为交互式行动者-评论家(IAC)的新型协作MARL算法,从策略与价值函数两个角度对智能体交互建模。在策略侧,通过采用协作探索模块引入多智能体联合随机策略,并以最大化熵正则化期望回报对其进行训练。在价值侧,我们利用共享注意力机制估计各智能体的价值函数,其中考虑了队友的影响。在实现层面,我们将价值分解方法拓展至连续控制任务,并在包括经典控制与多智能体粒子环境在内的基准任务上评估IAC。实验结果表明,我们的方法优于最先进的途径,并在协作方面取得更优性能。

关键词

引用

@article{arxiv.2102.06042,
  title  = {Modeling the Interaction between Agents in Cooperative Multi-Agent Reinforcement Learning},
  author = {Xiaoteng Ma and Yiqin Yang and Chenghao Li and Yiwen Lu and Qianchuan Zhao and Yang Jun},
  journal= {arXiv preprint arXiv:2102.06042},
  year   = {2021}
}