马尔可夫势博弈中分散式Softmax梯度-play的全局收敛速率
最优化与控制
2022-11-01 v2 多智能体系统
摘要
Softmax策略梯度是单智能体强化学习中策略优化的流行算法,尤其因为每次梯度更新无需投影。然而,在多智能体系统中,缺乏中心协调给收敛分析带来了显著的额外困难。即使对于利益一致的随机博弈,也可能存在多个纳什均衡(NEs),这使得依赖唯一全局最优存在的证明技术失效。此外,softmax参数化引入了具有零梯度的非NE策略,使得基于梯度的算法难以寻找NEs。本文研究一种特殊形式博弈——马尔可夫势博弈(MPGs,包含利益一致博弈作为特例)中分散式softmax梯度play的有限时间收敛性。我们考察了带与不带-barrier正则化的梯度play与自然梯度play。所建立的无正则化情形的收敛速率含有一个轨迹依赖常数,其可任意大;而-barrier正则化克服了该缺陷,代价是在对其他因素(如动作集大小)的依赖性上略差。在一个利益一致矩阵博弈上的实证研究证实了理论发现。
引用
@article{arxiv.2202.00872,
title = {On the Global Convergence Rates of Decentralized Softmax Gradient Play in Markov Potential Games},
author = {Runyu Zhang and Jincheng Mei and Bo Dai and Dale Schuurmans and Na Li},
journal= {arXiv preprint arXiv:2202.00872},
year = {2022}
}