中文

马尔可夫势博弈中分散式Softmax梯度-play的全局收敛速率

最优化与控制 2022-11-01 v2 多智能体系统

摘要

Softmax策略梯度是单智能体强化学习中策略优化的流行算法,尤其因为每次梯度更新无需投影。然而,在多智能体系统中,缺乏中心协调给收敛分析带来了显著的额外困难。即使对于利益一致的随机博弈,也可能存在多个纳什均衡(NEs),这使得依赖唯一全局最优存在的证明技术失效。此外,softmax参数化引入了具有零梯度的非NE策略,使得基于梯度的算法难以寻找NEs。本文研究一种特殊形式博弈——马尔可夫势博弈(MPGs,包含利益一致博弈作为特例)中分散式softmax梯度play的有限时间收敛性。我们考察了带与不带log\log-barrier正则化的梯度play与自然梯度play。所建立的无正则化情形的收敛速率含有一个轨迹依赖常数,其可任意大;而log\log-barrier正则化克服了该缺陷,代价是在对其他因素(如动作集大小)的依赖性上略差。在一个利益一致矩阵博弈上的实证研究证实了理论发现。

关键词

引用

@article{arxiv.2202.00872,
  title  = {On the Global Convergence Rates of Decentralized Softmax Gradient Play in Markov Potential Games},
  author = {Runyu Zhang and Jincheng Mei and Bo Dai and Dale Schuurmans and Na Li},
  journal= {arXiv preprint arXiv:2202.00872},
  year   = {2022}
}