通过乐观在线镜像下降最小化加权反事实遗憾
机器学习
2024-05-15 v2 人工智能
计算机科学与博弈论
摘要
反事实遗憾最小化(CFR)是一类有效求解不完美信息博弈的算法。它将总遗憾分解为反事实遗憾,利用局部遗憾最小化算法(如Regret Matching(RM)或RM+)来最小化它们。最近的研究建立了在线镜像下降(OMD)与RM+之间的联系,为乐观变体PRM+及其扩展PCFR+铺平了道路。然而,PCFR+在确定遗憾时为每次迭代分配均匀权重,导致面对占优动作时产生大量遗憾。本文探索了使用乐观OMD最小化加权反事实遗憾,从而产生了一种新的CFR变体PDCFR+。它以原则性的方式整合了PCFR+和折扣CFR(DCFR),迅速减轻占优动作的负面影响,并持续利用预测加速收敛。理论分析证明,PDCFR+收敛到纳什均衡,特别是在对遗憾和平均策略采用不同加权方案的情况下。实验结果表明,PDCFR+在常见的不完美信息博弈中收敛迅速。代码可在https://github.com/rpSebastian/PDCFRPlus获取。
引用
@article{arxiv.2404.13891,
title = {Minimizing Weighted Counterfactual Regret with Optimistic Online Mirror Descent},
author = {Hang Xu and Kai Li and Bingyun Liu and Haobo Fu and Qiang Fu and Junliang Xing and Jian Cheng},
journal= {arXiv preprint arXiv:2404.13891},
year = {2024}
}
备注
Accepted to 33rd International Joint Conference on Artificial Intelligence (IJCAI 2024)