中文

通过语言模型的外部与内部规划掌握棋盘游戏

人工智能 2025-05-26 v3 计算与语言 机器学习

摘要

提升大语言模型的规划和推理能力是释放其在复杂且具影响力的领域可靠发挥潜力的关键前提之一。在本文中,我们旨在通过棋盘游戏(国际象棋、菲舍尔随机棋/Chess960、四子棋和六边形棋)展示这一点,并表明基于搜索的规划可以显著提升 LLM 的游戏对弈强度。我们引入并比较了两种主要方法:在外部搜索中,模型在不调用外部游戏引擎的情况下引导蒙特卡洛树搜索的推演和评估;在内部搜索中,模型被训练为在上下文中生成线性化的搜索树及最终的决策。这两种方法均建立在基于相关领域知识预训练的语言模型之上,能够可靠地捕获各自环境中的状态转移和价值函数,且幻觉极少。我们评估了我们的 LLM 搜索实现与特定游戏的最先进引擎的对比,展示了相较于基础模型在棋力上的显著提升,并在国际象棋中达到了大师级水平,同时其运行更接近人类的搜索预算。我们提出的将搜索与领域知识相结合的方法并不局限于棋盘游戏,暗示了未来更广泛的应用前景。

关键词

引用

@article{arxiv.2412.12119,
  title  = {Mastering Board Games by External and Internal Planning with Language Models},
  author = {John Schultz and Jakub Adamek and Matej Jusup and Marc Lanctot and Michael Kaisers and Sarah Perrin and Daniel Hennes and Jeremy Shar and Cannada Lewis and Anian Ruoss and Tom Zahavy and Petar Veličković and Laurel Prince and Satinder Singh and Eric Malmi and Nenad Tomašev},
  journal= {arXiv preprint arXiv:2412.12119},
  year   = {2025}
}

备注

70 pages, 10 figures