中文

多智能体软Q学习

人工智能 2018-04-27 v1

摘要

策略梯度方法常被应用于连续多智能体博弈中的强化学习。这些方法在联合动作空间中进行局部搜索,并且正如我们所展示的,它们易受一种称为相对过度泛化的博弈论缺陷的影响。为解决此问题,我们提出多智能体软Q学习,可视为将Q-learning应用于连续控制的对应方法。我们将我们的方法与最先进的方法MADDPG进行比较,并表明我们的方法在多智能体协作任务中实现了更好的协调,在联合动作空间中收敛到更好的局部最优。

关键词

引用

@article{arxiv.1804.09817,
  title  = {Multiagent Soft Q-Learning},
  author = {Ermo Wei and Drew Wicke and David Freelan and Sean Luke},
  journal= {arXiv preprint arXiv:1804.09817},
  year   = {2018}
}

备注

Accepted in AAAI 18 Spring Symposium