独立自然策略梯度在马尔可夫势博弈中总是收敛
机器学习
2021-10-22 v1 计算机科学与博弈论
摘要
多智能体强化学习已成功应用于完全合作与完全竞争环境,但对于混合合作/竞争环境目前所知甚少。本文我们关注一类称为马尔可夫势博弈(MPGs)的多智能体混合合作/竞争随机博弈,其将合作博弈作为特例包含在内。近期结果表明独立策略梯度在 MPGs 中收敛,但独立自然策略梯度是否也在 MPGs 中收敛尚属未知。我们证明,使用恒定学习率时,独立自然策略梯度在末次迭代中总是收敛。该证明偏离已有方法,主要挑战在于马尔可夫势博弈不具有唯一最优值(如单智能体设定那样),因此不同初始化可导致不同极限点值。我们以实验补充理论结果,表明在自然策略梯度在路由博弈与拥塞博弈中优于策略梯度。
引用
@article{arxiv.2110.10614,
title = {Independent Natural Policy Gradient Always Converges in Markov Potential Games},
author = {Roy Fox and Stephen McAleer and Will Overman and Ioannis Panageas},
journal= {arXiv preprint arXiv:2110.10614},
year = {2021}
}
备注
24 pages