中文

UneVEn:面向多智能体强化学习的通用价值探索

机器学习 2021-06-11 v3 人工智能 多智能体系统

摘要

VDN 和 QMIX 是两种流行的基于价值的协作式多智能体强化学习(MARL)算法,它们将集中式动作价值函数学习为每个智能体效用的单调混合。虽然这便于将学到的策略去中心化,但受限的联合动作价值函数会阻碍它们解决在给定时间步需要智能体之间显著协调的任务。我们表明,这一问题可通过在训练期间改进所有智能体的联合探索来克服。具体而言,我们提出了一种称为通用价值探索(UneVEn)的新型 MARL 方法,该方法通过通用后继特征的线性分解同时学习一组相关任务。利用已解决的相关任务的策略,可以改善所有智能体的联合探索过程,从而帮助它们实现更好的协调。在一系列探索游戏、需要智能体间显著协调的具有挑战性的协作式捕食者-猎物任务以及 StarCraft II 微管理基准上的实证结果表明,UneVEn 能够解决其他最先进 MARL 方法失败的任务。

关键词

引用

@article{arxiv.2010.02974,
  title  = {UneVEn: Universal Value Exploration for Multi-Agent Reinforcement Learning},
  author = {Tarun Gupta and Anuj Mahajan and Bei Peng and Wendelin Böhmer and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2010.02974},
  year   = {2021}
}

备注

Published at ICML 2021