推理脚手架:从大语言模型(LLM)中提炼思维流程
人工智能
2025-10-02 v2
摘要
当前从大语言模型(LLMs)中提炼推理的主要方法——基于文本的行为模仿——存在根本性局限。它教会小型语言模型(SLMs)模仿表面级模式,而非思维背后的算法结构,导致逻辑鲁棒性严重不足。我们认为,提炼应直接传递算法结构,而非仅复制文本。我们提出推理脚手架(Reasoning Scaffolding)框架,将推理重新定义为结构化生成过程。该方法首先将教师的思考过程抽象为一序列离散、可解释的语义信号(如对比、加法),作为脚手架。随后,学生模型通过多任务目标学习:(1)预测下一个语义信号,预判推理流程;(2)在该信号条件下生成对应步骤。该多任务方案作为强大的正则化器,迫使学生内化连贯推理的计算模式。在一系列具有挑战性的推理基准测试上,我们的方法在准确率和逻辑一致性方面均显著优于最新专家 distillation 方法,为构建真正具有推理能力的小型模型提供了路径,而不仅是流畅的模仿者。
引用
@article{arxiv.2509.23619,
title = {Reasoning Scaffolding: Distilling the Flow of Thought from LLMs},
author = {Xiangyu Wen and Junhua Huang and Zeju Li and Min Li and Jianyuan Zhong and Zhijian Xu and Mingxuan Yuan and Yongxiang Huang and Qiang Xu},
journal= {arXiv preprint arXiv:2509.23619},
year = {2025}
}