扩展式博弈中的局部与自适应镜像下降
计算机科学与博弈论
2023-09-06 v1 机器学习
机器学习
摘要
我们研究在零和不完全信息博弈(IIG)中如何利用轨迹反馈学习 -最优策略。在此设定下,玩家基于固定轮数(记为 )内的观测顺序更新其策略。现有方法因对动作序列使用重要性采样而存在高方差(Steinberger 等,2020;McAleer 等,2022)。为降低方差,我们考虑一种固定采样方法,玩家仍随时间更新策略,但观测来自给定的固定采样策略。我们的方法基于自适应在线镜像下降(OMD)算法,该算法将 OMD 局部应用于每个信息集,采用各自递减的学习率与正则化损失。我们证明该方法以高概率保证 的收敛速率,并在采用最优理论学习率与采样策略时,对博弈参数具有近最优依赖。为取得这些结果,我们推广了 OMD 稳定的概念,允许具有凸增量的时变正则化。
引用
@article{arxiv.2309.00656,
title = {Local and adaptive mirror descents in extensive-form games},
author = {Côme Fiegel and Pierre Ménard and Tadashi Kozuno and Rémi Munos and Vianney Perchet and Michal Valko},
journal= {arXiv preprint arXiv:2309.00656},
year = {2023}
}