中文

关于膨胀熵的最优性及大规模形式博弈中在线学习的下界

机器学习 2024-11-01 v1 计算机科学与博弈论

摘要

一阶方法(FOMs)可以说是大规模形式博弈中均衡计算最具可扩展性的算法。为了实现这些方法,必须为策略空间选择一个距离生成函数,作为正则化项。正则化的强凸模数与直径之比是FOMs分析中的关键参数。一个自然的问题是:大规模形式决策空间的最优距离生成函数是什么?在本文中,我们做出了若干贡献,最终确立了权重为一的膨胀熵(DilEnt)距离生成函数在对数因子范围内是最优的。DilEnt正则化子因其与核化OMWU(KOMWU)的迭代等价性而值得注意——KOMWU是在大规模形式博弈中对博弈树规模依赖最先进的算法——当与在线镜像下降(OMD)算法结合使用时。然而,OMD的标准分析无法建立这样的结果;唯一的当前分析是通过诉诸与KOMWU的迭代等价性。我们通过引入一对原始-对偶树单纯形范数来填补这一空白,我们认为它们是研究DilEnt强凸性的自然分析视角。利用这些范数对,我们恢复了预测与KOMWU相同性能的直径-强凸性比率。结合在线学习在序列形式策略空间中的新遗憾下界,我们表明该比率几乎是最佳的。最后,我们通过细化DilEnt与Clairvoyant OMD配对的分析来展示我们的分析技术,在nn人博弈中建立了O(nlogVlogT/T)\mathcal{O}(n \log |\mathcal{V}| \log T/T)到粗相关均衡的逼近率,其中V|\mathcal{V}|是玩家的简化正规形式策略数,建立了新的最先进结果。

关键词

引用

@article{arxiv.2410.23398,
  title  = {On the Optimality of Dilated Entropy and Lower Bounds for Online Learning in Extensive-Form Games},
  author = {Zhiyuan Fan and Christian Kroer and Gabriele Farina},
  journal= {arXiv preprint arXiv:2410.23398},
  year   = {2024}
}