RL-CFR:利用强化学习改进不完美信息扩展式博弈的动作抽象
计算机科学与博弈论
2024-03-08 v1 机器学习
摘要
有效的动作抽象对于解决不完美信息扩展式博弈(IIEFGs)中大动作空间相关的挑战至关重要。然而,由于 IIEFGs 中巨大的状态空间和计算复杂度,现有方法往往依赖固定抽象,导致性能次优。为此,我们引入了 RL-CFR,一种用于动态动作抽象的新型强化学习(RL)方法。RL-CFR 建立在我们创新的马尔可夫决策过程(MDP)公式之上,其中状态对应公共信息,动作表示为指示特定动作抽象的特征向量。奖励定义为所选动作抽象与默认动作抽象之间的期望收益差。RL-CFR 构建了具有 RL 引导动作抽象的博弈树,并利用反事实遗憾最小化(CFR)进行策略推导。令人印象深刻的是,它可以从头开始训练,在不增加 CFR 求解时间的情况下实现更高的期望收益。在单挑无限注德州扑克(Heads-up No-limit Texas Hold'em)的实验中,RL-CFR 优于 ReBeL 的复现版和 Slumbot,分别展示了 和 mbb/hand 的显著胜率优势。
引用
@article{arxiv.2403.04344,
title = {RL-CFR: Improving Action Abstraction for Imperfect Information Extensive-Form Games with Reinforcement Learning},
author = {Boning Li and Zhixuan Fang and Longbo Huang},
journal= {arXiv preprint arXiv:2403.04344},
year = {2024}
}