中文

策略梯度算法在线性二次型博弈中无收敛保证

机器学习 2019-12-18 v2 机器学习

摘要

我们通过反例表明,在连续动作与状态空间的多智能体设定下,策略梯度算法甚至无法保证局部收敛到纳什均衡。为此,我们分析了 N 人一般和线性二次型博弈中的梯度博弈,这是一类经典的博弈设定,近期正作为多智能体学习领域的基准而出现。在此类博弈中,状态与动作空间是连续的,且可通过求解耦合的 Ricatti 方程找到全局纳什均衡。此外,LQ 博弈中的梯度博弈等价于多智能体策略梯度。我们首先表明,这些博弈令人惊讶地并非凸博弈。尽管如此,我们仍能证明梯度动力学唯一的临界点是全局纳什均衡。随后我们给出策略梯度将避开纳什均衡的充分条件,并生成大量满足这些条件的一般和线性二次型博弈。在此类博弈中,我们经实证观察到博弈方收敛到极限环,其时间平均与纳什均衡不一致。此类博弈的存在表明,在经典强化学习设定中求解强化学习问题最流行的方法之一,在多智能体设定下并无局部收敛保证。此外,我们生成这些反例的轻易程度表明,此类情形并非仅是边缘情况,实际上相当常见。

关键词

引用

@article{arxiv.1907.03712,
  title  = {Policy-Gradient Algorithms Have No Guarantees of Convergence in Linear Quadratic Games},
  author = {Eric Mazumdar and Lillian J. Ratliff and Michael I. Jordan and S. Shankar Sastry},
  journal= {arXiv preprint arXiv:1907.03712},
  year   = {2019}
}