反事实遗憾最小化与在线镜像下降的等价性分析
机器学习
2022-04-20 v2
摘要
Follow-the-Regularized-Lead(FTRL)和在线镜像下降(OMD)是在线凸优化(OCO)中的遗憾最小化算法,它们在数学上优雅,但在求解扩展式博弈(EFGs)时实用性不足。反事实遗憾最小化(CFR)是一种在EFGs中逼近纳什均衡的技术。CFR及其变体在实践中收敛速度快,但其理论结果尚不令人满意。近年来,研究者试图将CFRs与OCO算法联系起来,这可能提供新的理论结果并启发新算法。然而,现有分析仅限于局部决策点。本文中,我们证明了采用Regret Matching和Regret Matching+的CFRs分别等价于FTRL和OMD的特例。根据这些等价关系,推导出了一种新的FTRL和一种新的OMD算法,可视为原始CFR和CFR+的扩展。实验结果表明,这两种变体比常规FTRL和OMD收敛更快,在某些EFGs中甚至快于原始CFR和CFR+。
引用
@article{arxiv.2110.04961,
title = {Equivalence Analysis between Counterfactual Regret Minimization and Online Mirror Descent},
author = {Weiming Liu and Huacong Jiang and Bin Li and Houqiang Li},
journal= {arXiv preprint arXiv:2110.04961},
year = {2022}
}