中文

扩展式博弈中的局部与自适应镜像下降

计算机科学与博弈论 2023-09-06 v1 机器学习 机器学习

摘要

我们研究在零和不完全信息博弈(IIG)中如何利用轨迹反馈学习 ϵ\epsilon-最优策略。在此设定下,玩家基于固定轮数(记为 TT)内的观测顺序更新其策略。现有方法因对动作序列使用重要性采样而存在高方差(Steinberger 等,2020;McAleer 等,2022)。为降低方差,我们考虑一种固定采样方法,玩家仍随时间更新策略,但观测来自给定的固定采样策略。我们的方法基于自适应在线镜像下降(OMD)算法,该算法将 OMD 局部应用于每个信息集,采用各自递减的学习率与正则化损失。我们证明该方法以高概率保证 O~(T1/2)\tilde{\mathcal{O}}(T^{-1/2}) 的收敛速率,并在采用最优理论学习率与采样策略时,对博弈参数具有近最优依赖。为取得这些结果,我们推广了 OMD 稳定的概念,允许具有凸增量的时变正则化。

关键词

引用

@article{arxiv.2309.00656,
  title  = {Local and adaptive mirror descents in extensive-form games},
  author = {Côme Fiegel and Pierre Ménard and Tadashi Kozuno and Rémi Munos and Vianney Perchet and Michal Valko},
  journal= {arXiv preprint arXiv:2309.00656},
  year   = {2023}
}