中文

一般和马尔可夫博弈中相关均衡的近似最优策略优化

机器学习 2024-05-03 v2 计算机科学与博弈论 最优化与控制

摘要

我们研究了多玩家一般和马尔可夫博弈中计算相关均衡的策略优化算法。先前的结果实现了O(T1/2)O(T^{-1/2})收敛到相关均衡的速率,以及O(T3/4)O(T^{-3/4})加速收敛到较弱概念——粗相关均衡的速率。在本文中,我们通过提供一种非耦合策略优化算法,显著改进了这两个结果,该算法在计算相关均衡时达到了接近最优的O~(T1)\tilde{O}(T^{-1})收敛速率。我们的算法通过结合两个主要元素构建:(i) 平滑值更新和(ii) 使用对数障碍正则化器的乐观跟随正则化领导者算法。

关键词

引用

@article{arxiv.2401.15240,
  title  = {Near-Optimal Policy Optimization for Correlated Equilibrium in General-Sum Markov Games},
  author = {Yang Cai and Haipeng Luo and Chen-Yu Wei and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2401.15240},
  year   = {2024}
}

备注

AISTATS 2024 Oral