通过大师蒸馏实现语言模型的具身国际象棋推理
人工智能
2026-03-24 v1
摘要
语言模型常在训练数据稀缺但专用系统却优异的专业领域缺乏具身推理能力。我们提出一种通用框架,将专家系统推理蒸馏为自然语言链式思维解释,使紧凑模型获得领域专业知识及生成忠实、具身解释的能力。我们不仅蒸馏最终输出,更捕获完整推理过程,将不透明的专家计算转化为透明、逐步的解释。我们在国际象棋这一典型推理领域中展示了此方法,语言模型在此仍表现不佳。我们的 4B 参数模型 C1 从接近零的基线提升至 48.1% 准确率,超越所有开源模型和大多数前沿专有系统。值得注意的是,C1 超越了自己的蒸馏教师,生成的解决方案token数比基线少两个数量级。不同于以往神经国际象棋方法仅预测最佳走子,C1 生成可解释的解答,揭示战略推理。我们的管道结合了监督微调和强化学习,采用主题平衡数据采样实现全面的战术覆盖。大师蒸馏展示了如何将专家水平知识注入紧凑模型以解决非优化领域的方法,为在 LLM 缺乏足够基础能力时的 RLVR 提供了配方。
引用
@article{arxiv.2603.20510,
title = {Grounded Chess Reasoning in Language Models via Master Distillation},
author = {Zhenwei Tang and Qianfeng Wen and Seth Grief-Albert and Yahya Elgabra and Blair Yang and Honghua Dong and Ashton Anderson},
journal= {arXiv preprint arXiv:2603.20510},
year = {2026}
}