无需强化学习或蒸馏训练 LLM 推理能力的挑战
人工智能
2025-07-17 v3
摘要
能够实现推理能力的语言模型通过生成长篇、显式的链式思维 (CoT) 轨迹,在 diverse complex 任务中取得最新性能。虽然最近的工作表明,基础模型可通过强化学习或从更强大的模型(如 DeepSeek-R1)进行蒸馏获得此类推理轨迹,但之前的工作表明,即使在不进行微调的情况下,短链式思维提示也能提升推理性能。我们询问是否仅通过提示或最小化调优即可诱导长链式思维。在本研究中,我们仅使用来自推理模型 \texttt{QwQ-32B-Preview} 的 20 个长链式思维示例,对基础模型 \texttt{Qwen2.5-32B} 进行轻微微调。结果模型超越了更大规模的 \texttt{Qwen2.5-Math-72B-Instruct},表明仅需少量高质量示例即可激发强大的推理能力。我们进一步探索使用来自非推理模型和人类标注者的 CoT 数据,通过提示工程、多轮编辑和结构引导等方式增强。然而, neither 匹配推理模型轨迹的性能,这表明专家链式思维的某些潜在特性难以复制。我们分析了影响推理蒸馏的关键属性,如问题难度、多样性和答案长度。尽管仍存在挑战,我们对精心策划的 human-authored CoT,即使数量有限,也能激活基础模型中的推理行为持乐观。我们发布我们的 human-authored 数据集跨多个精炼阶段,并邀请进一步调查小规模推理监督为何如此有效。
引用
@article{arxiv.2507.09850,
title = {The Challenge of Teaching Reasoning to LLMs Without RL or Distillation},
author = {Wei Du and Branislav Kisacanin and George Armstrong and Shubham Toshniwal and Ivan Moshkov and Alexan Ayrapetyan and Sadegh Mahdavi and Dan Zhao and Shizhe Diao and Dragan Masulovic and Marius Stanean and Advaith Avadhanam and Max Wang and Ashmit Dutta and Shitij Govil and Sri Yanamandara and Mihir Tandon and Sriram Ananthakrishnan and Vedant Rathi and David Zhang and Joonseok Kang and Leon Luo and Titu Andreescu and Boris Ginsburg and Igor Gitman},
journal= {arXiv preprint arXiv:2507.09850},
year = {2025}
}
备注
Accepted at the Second AI for Math Workshop at the 42nd International Conference on Machine Learning (ICML 2025)