不完美回忆扩展式博弈中的无遗憾学习
计算机科学与博弈论
2012-05-04 v1 人工智能
摘要
反事实遗憾最小化 (CFR) 是一种高效的无遗憾学习算法,适用于建模为扩展式博弈的决策问题。CFR 的遗憾界依赖于完美回忆的要求:玩家总是记得向他们揭示的信息以及揭示的顺序。然而,在不具有完美回忆的博弈中,CFR 的保证并不适用。在本文中,我们提出了将 CFR 应用于一类具有不完美回忆的通用博弈时的首个遗憾界。此外,我们表明,将 CFR 应用于属于我们通用类别的任何抽象,不仅能为抽象博弈产生遗憾界,也能为完整博弈产生遗憾界。我们验证了我们的理论,并展示了如何在三个领域(掷骰子扑克、幻影井字棋和 bluff)中利用不完美回忆,以遗憾的微小增加换取内存的显著减少。
引用
@article{arxiv.1205.0622,
title = {No-Regret Learning in Extensive-Form Games with Imperfect Recall},
author = {Marc Lanctot and Richard Gibson and Neil Burch and Martin Zinkevich and Michael Bowling},
journal= {arXiv preprint arXiv:1205.0622},
year = {2012}
}
备注
21 pages, 4 figures, expanded version of article to appear in Proceedings of the Twenty-Ninth International Conference on Machine Learning