理解深度协作多智能体强化学习中的价值分解算法
机器学习
2022-02-17 v2 人工智能
机器学习
摘要
价值函数分解正成为在合作博弈中扩展多智能体强化学习(MARL)的流行经验法则。为使这种分解规则成立,必须假设个体-全局最大值(IGM)原则;即每个智能体分解价值函数上的局部最大值必须等于联合价值函数上的全局最大值。然而,这一原则通常不一定成立。因此,价值分解算法的适用性被掩盖,其相应的收敛性质仍然未知。在本文中,我们首次尝试回答这些问题。具体来说,我们引入了价值分解方法在其中找到其有效性的合作博弈集合,称之为可分解博弈。在可分解博弈中,我们从理论上证明,应用多智能体拟合Q迭代算法(MA-FQI)将得到最优Q函数。在不可分解博弈中,如果在每次迭代时都需要将Q函数投影到可分解函数空间,MA-FQI估计的Q函数仍然可以收敛到最优值。在这两种设定下,我们都考虑了使用实际深度神经网络表示价值函数,并推导了它们相应的收敛速率。总而言之,我们的结果首次为MARL实践者提供了关于价值分解算法何时收敛以及为何表现良好的理论见解。
引用
@article{arxiv.2202.04868,
title = {Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning},
author = {Zehao Dou and Jakub Grudzien Kuba and Yaodong Yang},
journal= {arXiv preprint arXiv:2202.04868},
year = {2022}
}
备注
37 pages