中文

跳过思考:分块链索蒸馏使小型语言模型更快更好地推理

计算与语言 2025-05-27 v1

摘要

链索蒸馏(CoT)允许大型语言模型(LLM)指导小型语言模型(SLM)在推理任务中进行学习。现有方法训练 SLM 以学习单次迭代中的长篇理由,导致两个问题:1)长篇理由会导致训练期间的大型标记级批处理大小,使得核心推理标记(即会直接影响后续推理正确性的标记)的梯度被平滑处理,因为它们在理由中的比例极小。结果,SLM 收敛到锐利的最小值,无法把握推理逻辑。2)响应缓慢,因为 SLM 必须在到达答案之前生成长篇理由。因此,我们提出了分块训练(CWT),使用启发式搜索将理由划分为内部语义连贯的块,并 focus SLM 只在每次迭代中学习一个块。如此一来,CWT 天然地将不涉及核心推理标记的块(例如摘要和过渡块)从 SLM 的学习中隔离,增加了该迭代中核心推理标记的比例。基于 CWT,提出了跳过思考训练(STT)。STT 使 SLM 自动跳过非推理中等块,以到达答案,同时保持准确性,从而提高推理速度。我们在多种 SLM 和多个推理任务上对我们的方案进行了验证。

关键词

引用

@article{arxiv.2505.18642,
  title  = {Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Faster},
  author = {Xiao Chen and Sihang Zhou and Ke Liang and Xiaoyu Sun and Xinwang Liu},
  journal= {arXiv preprint arXiv:2505.18642},
  year   = {2025}
}