中文

势博弈的独立自然策略梯度方法:带熵正则化的有限时间全局收敛

最优化与控制 2022-08-31 v2 计算机科学与博弈论 信息论 机器学习 math.IT

摘要

多智能体系统的一个主要挑战在于系统复杂度随智能体数量及其动作空间大小急剧增长,这在自动驾驶车辆、机器人团队、网络路由等真实场景中是典型现象。因此亟需设计去中心化或独立算法,其中每个智能体的更新仅基于其局部观测,而无需引入复杂的通信/协调机制。本文研究势博弈中独立熵正则化自然策略梯度(NPG)方法的有限时间收敛性,其中智能体效用函数因单边偏离而产生的差异恰好等于一个公共势函数的差异。所提熵正则化 NPG 方法使每个智能体能依据自身收益进行对称的、去中心化的、乘性的更新。我们证明该方法以次线性速率收敛至量化响应均衡(QRE)——即熵正则化博弈的均衡——该速率与动作空间大小无关,且随智能体数量至多次线性增长。引人注目的是,对于重要的特例利益一致博弈,收敛速率进一步与智能体数量无关,从而成为首个以无维度依赖速率收敛的方法。我们的方法可用作平滑技术,在未假设平稳策略孤立的条件下求原未正则化问题的近似纳什均衡(NE)。

关键词

引用

@article{arxiv.2204.05466,
  title  = {Independent Natural Policy Gradient Methods for Potential Games: Finite-time Global Convergence with Entropy Regularization},
  author = {Shicong Cen and Fan Chen and Yuejie Chi},
  journal= {arXiv preprint arXiv:2204.05466},
  year   = {2022}
}