中文

协作多智能体强化学习的分层策略

机器学习 2022-12-15 v1 多智能体系统

摘要

充分策略化智能体行为是求解协作多智能体强化学习(MARL)问题的关键。该领域中一种直观有益却不常见的方法是预测智能体未来行为并相应规划。利用此点,我们提出一种两级分层架构,将新颖的信息论目标与轨迹预测模型结合以学习策略。为此,我们引入一种潜变量策略,利用改进的图注意力网络模块提取交互特征,学习两类潜变量策略:个体zAz_A与关系zRz_R。我们通过对每个智能体的局部QQ函数以zAz_A为条件,促使其按策略行动,并进一步为智能体配备以zRz_R为条件的共享QQ函数。此外,我们引入两个正则化项以使预测轨迹准确且获高回报。在Google Research Football(GRF)与StarCraft(SC)II微操任务上的实证结果表明,我们的方法确立了新的最优性能(state of the art),据我们所知,是首个解决所有超难SC II场景以及胜率高于95%95\%的GRF完整比赛的MARL算法,从而优于所有现有方法。方法与结果的视频及简要概览见:https://sites.google.com/view/hier-strats-marl/home。

关键词

引用

@article{arxiv.2212.07397,
  title  = {Hierarchical Strategies for Cooperative Multi-Agent Reinforcement Learning},
  author = {Majd Ibrahim and Ammar Fayad},
  journal= {arXiv preprint arXiv:2212.07397},
  year   = {2022}
}