中文

带_bandit反馈的双人零和马尔可夫博弈中的无耦合收敛学习

计算机科学与博弈论 2023-11-10 v2 机器学习

摘要

我们重新审视双人零和马尔可夫博弈中的学习问题,致力于开发一种无耦合、收敛且理性的算法,并具有非渐近收敛速率。作为热身,我们从无状态矩阵博弈在 bandit 反馈下的情形入手,展示了 O(t18)O(t^{-\frac{1}{8}}) 的末次迭代收敛速率。据我们所知,这是首个在仅能获取 bandit 反馈条件下获得有限末次迭代收敛速率的结果。我们将结果推广到不可约马尔可夫博弈的情形,给出了对任意 ε>0\varepsilon>0 均为 O(t19+ε)O(t^{-\frac{1}{9+\varepsilon}}) 的末次迭代收敛速率。最后,我们研究对动态无任何假设的马尔可夫博弈,并展示了一种路径收敛速率——这是我们定义的一种新收敛概念——为 O(t110)O(t^{-\frac{1}{10}})。我们的算法去除了 [Wei et al., 2021] 的协调与先验知识要求,该文献针对不可约马尔可夫博弈追求与我们相同的目标。我们的算法与 [Chen et al., 2021, Cen et al., 2021] 相关,并同样建立在熵正则化技术之上。然而,我们去除了它们对熵值通信的要求,使我们的算法完全无耦合。

关键词

引用

@article{arxiv.2303.02738,
  title  = {Uncoupled and Convergent Learning in Two-Player Zero-Sum Markov Games with Bandit Feedback},
  author = {Yang Cai and Haipeng Luo and Chen-Yu Wei and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2303.02738},
  year   = {2023}
}

备注

To appear at NeurIPS 2023