多智能体软Q学习
人工智能
2018-04-27 v1
摘要
策略梯度方法常被应用于连续多智能体博弈中的强化学习。这些方法在联合动作空间中进行局部搜索,并且正如我们所展示的,它们易受一种称为相对过度泛化的博弈论缺陷的影响。为解决此问题,我们提出多智能体软Q学习,可视为将Q-learning应用于连续控制的对应方法。我们将我们的方法与最先进的方法MADDPG进行比较,并表明我们的方法在多智能体协作任务中实现了更好的协调,在联合动作空间中收敛到更好的局部最优。
引用
@article{arxiv.1804.09817,
title = {Multiagent Soft Q-Learning},
author = {Ermo Wei and Drew Wicke and David Freelan and Sean Luke},
journal= {arXiv preprint arXiv:1804.09817},
year = {2018}
}
备注
Accepted in AAAI 18 Spring Symposium