中文

通过基于反事实价值的虚拟对弈加速蒙特卡洛设定下的纳什均衡收敛

人工智能 2024-10-29 v4 计算机科学与博弈论 机器学习

摘要

反事实后悔最小化(CFR)及其变体被广泛认为是求解扩展式不完美信息博弈的有效算法。近来,许多改进工作集中于提升 CFR 算法的收敛速度。然而,这些变体大多不适用于蒙特卡洛(MC)条件,因而难以用于大规模博弈的训练。我们提出了一种基于 MC 的求解扩展式不完美信息博弈的新算法,称为 MCCFVFP(蒙特卡洛基于反事实价值的虚拟对弈)。MCCFVFP 将 CFR 的反事实价值计算与虚拟对弈的最佳响应策略相结合,利用虚拟对弈的优势在具有较高比例被占优策略的博弈中获得显著优势。实验结果表明,在扑克等博弈及其他测试博弈中,MCCFVFP 的收敛速度比最先进的 MCCFR 变体快约 20%\sim50%。

关键词

引用

@article{arxiv.2309.03084,
  title  = {Accelerating Nash Equilibrium Convergence in Monte Carlo Settings Through Counterfactual Value Based Fictitious Play},
  author = {Ju Qi and Falin Hei and Ting Feng and Dengbing Yi and Zhemei Fang and Yunfeng Luo},
  journal= {arXiv preprint arXiv:2309.03084},
  year   = {2024}
}