中文

大语言模型能否发展出战略推理能力?基于学习象棋的后训练洞察

人工智能 2025-08-29 v3 机器学习

摘要

虽然强化学习(RL)在大语言模型(LLM)的数学推理方面取得了一些进展,但针对 LLM 战略推理的 RL 研究仍寥寥无几。我们探讨了通过 RL 是否可以让 LLM 发展出战略推理能力,以象棋为例。为此,我们利用chess-pretrained action-value network 提供稠密奖励,以衡量 LLM 输出棋步质量,这可视为一种知识蒸馏形式。我们的实验表明,基于 distillation 的稠密奖励常常优于稀疏的二进制奖励。然而,令人惊讶的是,所有模型都在远低于专家水平的高度停滞。我们对象棋推理训练进行了 SFT 与 RL 的消融实验,发现这一局限性源于预训练模型内部对象棋理解能力的不足——而 RL 本身可能难以完全克服这一缺陷。代码已公开于 https://github.com/krafton-ai/Chess-R1。

关键词

引用

@article{arxiv.2507.00726,
  title  = {Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess},
  author = {Dongyoon Hwang and Hojoon Lee and Jaegul Choo and Dongmin Park and Jongho Park},
  journal= {arXiv preprint arXiv:2507.00726},
  year   = {2025}
}

备注

Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages