基础模型懂得推理,思考模型学会何时思考
人工智能
2025-10-23 v3 机器学习
摘要
为何深度思考语言模型如 DeepSeek R1 能超越其基础模型?尽管性能持续提升,但仍不清楚思考模型是否学习了全新的推理能力,或仅仅是重用基础模型的既有能力。本文提出一种混合模型,通过在恰当时机激活基础模型中的推理机制,以诱发思考模型水平的推理链,暗示思考模型利用了已存在的能力。为奠定分析基础,我们引入一种自下而上的无监督方法,揭示思考模型中人类可解释的推理行为。该方法提供了一种不引入人工或基于 LLM 假设的无偏方法来发现推理行为。我们测试了三个基础模型和四个思考模型,在 GSM8K 和 MATH500 数据集上,该混合模型在无任何权重更新情况下,能恢复至多 91% 的性能差距,仅需激活约 12% 的 token。具体而言,我们的实验设置提供了一种简单而因果的方式,通过直接调用这些机制并测量相应任务性能来检验基础模型中现有推理机制的有效性。更广泛地说,这些结果重新框架化了我们对思考模型训练方式的理解:预训练是模型获取大多数推理机制的时期,后训练则教会模型在恰当时机高效部署这些机制,从而实现对推理时计算资源的高效利用。
引用
@article{arxiv.2510.07364,
title = {Base Models Know How to Reason, Thinking Models Learn When},
author = {Constantin Venhoff and Iván Arcuschin and Philip Torr and Arthur Conmy and Neel Nanda},
journal= {arXiv preprint arXiv:2510.07364},
year = {2025}
}
备注
10 pages, Accepted to the Mechanistic Interpretability Workshop at NeurIPS 2025