大语言模型能否发展出战略推理能力?基于学习象棋的后训练洞察
人工智能
2025-08-29 v3 机器学习
摘要
虽然强化学习(RL)在大语言模型(LLM)的数学推理方面取得了一些进展,但针对 LLM 战略推理的 RL 研究仍寥寥无几。我们探讨了通过 RL 是否可以让 LLM 发展出战略推理能力,以象棋为例。为此,我们利用chess-pretrained action-value network 提供稠密奖励,以衡量 LLM 输出棋步质量,这可视为一种知识蒸馏形式。我们的实验表明,基于 distillation 的稠密奖励常常优于稀疏的二进制奖励。然而,令人惊讶的是,所有模型都在远低于专家水平的高度停滞。我们对象棋推理训练进行了 SFT 与 RL 的消融实验,发现这一局限性源于预训练模型内部对象棋理解能力的不足——而 RL 本身可能难以完全克服这一缺陷。代码已公开于 https://github.com/krafton-ai/Chess-R1。
引用
@article{arxiv.2507.00726,
title = {Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess},
author = {Dongyoon Hwang and Hojoon Lee and Jaegul Choo and Dongmin Park and Jongho Park},
journal= {arXiv preprint arXiv:2507.00726},
year = {2025}
}
备注
Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages