易如 ABC:统一 Boltzmann Q 学习与反事实遗憾最小化
机器学习
2024-02-20 v1 计算机科学与博弈论
多智能体系统
摘要
我们提出了 ABCs(通过子节点平稳性实现的自适应分支),这是一种兼具两者优势的算法,结合了用于单智能体领域的经典强化学习算法 Boltzmann Q 学习(BQL)和用于多智能体领域学习的核心算法反事实遗憾最小化(CFR)。ABCs 通过测量环境奖励和转移动力学的平稳性,自适应地选择每次迭代中要探索的环境比例。在马尔可夫决策过程中,ABCs 收敛至最优策略,其速度相比 BQL 最多慢一个 因子,其中 是环境中的动作数量。在双人零和博弈中,ABCs 保证收敛至纳什均衡(假设可访问用于检测平稳性的完美预言机),而 BQL 没有此类保证。实证表明,ABCs 在来自 OpenSpiel 游戏库和 OpenAI Gym 的环境基准测试中表现出强劲性能,并在那些既非完全平稳也非完全非平稳的环境中超越了所有先前的方法。
引用
@article{arxiv.2402.11835,
title = {Easy as ABCs: Unifying Boltzmann Q-Learning and Counterfactual Regret Minimization},
author = {Luca D'Amico-Wong and Hugh Zhang and Marc Lanctot and David C. Parkes},
journal= {arXiv preprint arXiv:2402.11835},
year = {2024}
}