中文

强化学习、量化响应均衡与二人零和博弈的统一方法

机器学习 2023-04-12 v4 人工智能 计算机科学与博弈论

摘要

本研究探讨了一种受镜像下降与非欧几里得近端梯度算法启发的算法,称之为磁镜像下降。我们的贡献在于展示了磁镜像下降作为均衡求解器及作为二人零和博弈中强化学习方法的优势。这些优势包括:1) 首个在具有一阶反馈的扩展式博弈中实现线性收敛的量化响应均衡求解器;2) 首个在表格设定下取得与 CFR 经验竞争性结果的标标准强化学习算法;3) 作为自博弈深度强化学习算法在 3x3 Dark Hex 和 Phantom Tic-Tac-Toe 中取得良好性能。

关键词

引用

@article{arxiv.2206.05825,
  title  = {A Unified Approach to Reinforcement Learning, Quantal Response Equilibria, and Two-Player Zero-Sum Games},
  author = {Samuel Sokota and Ryan D'Orazio and J. Zico Kolter and Nicolas Loizou and Marc Lanctot and Ioannis Mitliagkas and Noam Brown and Christian Kroer},
  journal= {arXiv preprint arXiv:2206.05825},
  year   = {2023}
}