中文

不完美信息扩展式博弈中的广义赌博机后悔最小化框架

机器学习 2023-08-21 v4 计算机科学与博弈论

摘要

后悔最小化方法是学习二人零和不完美信息扩展式博弈(IIEGs)中近似纳什均衡(NE)的有力工具。我们考虑交互式赌博机反馈设置下的该问题,其中我们不知道 IIEG 的动态。一般而言,仅揭示交互轨迹和到达的终止节点值 v(zt)v(z^t)。为学习 NE,要求后悔最小化器通过 v(zt)v(z^t) 估计全反馈损失梯度 t\ell^t 并最小化后悔。本文针对该学习设置提出了一个广义框架。它给出了赌博机后悔最小化方法设计与模块化分析的理论框架。我们证明最新的赌博机后悔最小化方法均可作为我们框架的特例进行分析。遵循该框架,我们描述了一种学习近似 NE 的新方法 SIX-OMD。它是无模型的,并将现有最佳收敛速率从 O(XB/T+YC/T)O(\sqrt{X B/T}+\sqrt{Y C/T}) 量级显著提升至 O(MX/T+MY/T)O(\sqrt{ M_{\mathcal{X}}/T} +\sqrt{ M_{\mathcal{Y}}/T})。此外,SIX-OMD 计算高效,因为它仅需沿采样轨迹执行当前策略与平均策略更新。

关键词

引用

@article{arxiv.2203.05920,
  title  = {Generalized Bandit Regret Minimizer Framework in Imperfect Information Extensive-Form Game},
  author = {Linjian Meng and Yang Gao},
  journal= {arXiv preprint arXiv:2203.05920},
  year   = {2023}
}

备注

The proof of this paper includes many errors, especially for SIX-OMD, the regret bound of this algorithm is not right since this regret is lower than the lowest theoretical regret bound obtained by information theory