中文

推理如何从训练数据后演化:基于国际象棋的实证研究

机器学习 2026-05-05 v2 人工智能

摘要

我们研究了语言模型在从监督微调 (SFT) 到强化学习 (RL) 期间推理是如何演化的,通过分析一组理论驱动的数据集如何影响语言模型在国际象棋中的表现。我们发现,对模型进行微调以直接预测最佳棋子会导致有效的 RL 和最强的下游性能——但 RL 阶段会触发不忠实的推理(与所选棋子不一致的推理)。或者,针对多步轨迹进行训练可获得相当的下游性能,同时保持推理忠实且更稳定的 RL。我们分析了多个定性和定量措施,并指出这些措施如何从 SFT 经过 RL 演化;我们发现Several SFT-checkpoint 指标——涵盖评估性能、幻觉率和推理质量——可预测 RL 后的模型性能。最后,我们通过测量我们自定义数据集中的“国际象棋信息密度”来支撑我们的发现。我们公开了模型以及训练数据、评估和代码,成功超越了领先的开源推理模型,仅用 7B 参数模型即可在国际象棋中取得优异成绩。代码、模型和数据均可在 https://github.com/lucasdino/lang-chess 获取。

关键词

引用

@article{arxiv.2604.05134,
  title  = {How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess},
  author = {Lucas Dionisopoulos and Nicklas Majamaki and Prithviraj Ammanabrolu},
  journal= {arXiv preprint arXiv:2604.05134},
  year   = {2026}
}

备注

Accepted at ICML 2026. An earlier version appeared at the NeurIPS 2025 Foundations of Reasoning in Language Models (FoRLM) Workshop (Oral)