Minimax 卷土重来
人工智能
2026-04-24 v2
摘要
深度强化学习在许多完全信息博弈中达到了超人类的博弈水平。零知识学习的最先进算法是 AlphaZero。我们采用另一种方法 Athénan,它使用一种不同的、基于 Minimax 的搜索算法 Descent,以及不同的学习目标,并且不使用策略网络。我们表明,对于多种博弈,它比 AlphaZero 的重新实现 Polygames 高效得多:当 Polygames 使用多 100 倍的 GPU 时(至少对某些博弈而言),Athénan 仍具竞争力。其优越性能的关键之一在于,使用 Athénan 生成用于训练的状态数据的成本约为低 296 倍。在相同的合理资源下,不带强化启发式的 Athénan 比 Polygames 至少快 7 倍,而带强化启发式时快 30 倍以上。
引用
@article{arxiv.2012.10700,
title = {Minimax Strikes Back},
author = {Quentin Cohen-Solal and Tristan Cazenave},
journal= {arXiv preprint arXiv:2012.10700},
year = {2026}
}