中文

基于大规模Transformer的摊销规划:以国际象棋为例的研究

机器学习 2024-10-22 v2 人工智能 机器学习

摘要

本文使用国际象棋这一AI领域的标志性规划问题,来评估Transformer在记忆无效的规划任务上的性能——即使在大规模情况下也是如此。为此,我们发布了ChessBench,这是一个包含1000万局国际象棋游戏的大型基准数据集,带有由最先进的国际象棋引擎Stockfish 16提供的合法走法和价值标注(150亿个数据点)。我们通过监督学习在ChessBench上训练了多达2.7亿参数的Transformer,并进行了广泛的消融实验,以评估数据集大小、模型大小、架构类型和不同预测目标(状态值、动作值和行为克隆)的影响。我们最大的模型学会了非常准确地预测新棋盘的动作值,这意味着高度非平凡的泛化能力。尽管没有执行任何显式搜索,我们生成的国际象棋策略解决了具有挑战性的国际象棋难题,并在与人类对弈中达到了惊人的2895 Lichess快棋Elo等级分(大师级水平)。我们还在有无搜索的情况下与Leela Chess Zero和AlphaZero(通过自博弈无监督训练)进行了比较。我们表明,尽管可以通过监督学习将Stockfish基于搜索的算法的非常好的近似蒸馏到大规模Transformer中,但完美的蒸馏仍然遥不可及,因此ChessBench非常适合未来的研究。

关键词

引用

@article{arxiv.2402.04494,
  title  = {Amortized Planning with Large-Scale Transformers: A Case Study on Chess},
  author = {Anian Ruoss and Grégoire Delétang and Sourabh Medapati and Jordi Grau-Moya and Li Kevin Wenliang and Elliot Catt and John Reid and Cannada A. Lewis and Joel Veness and Tim Genewein},
  journal= {arXiv preprint arXiv:2402.04494},
  year   = {2024}
}