中文

利用自适应思维从大语言模型中蒸馏推理能力

计算与语言 2025-08-08 v6

摘要

思维链微调(cot-finetuning)旨在赋予小语言模型(SLM)推理能力,通过让它们模仿大语言模型(LLM)的推理过程,而不仅仅是预测答案,来提高其在特定任务上的表现。现有的大多数思维链微调方法采用预思考机制,允许小语言模型在提供答案之前生成推理依据。这种机制使小语言模型能够分析和思考复杂问题,但也使得答案的正确性对推理依据中的微小错误高度敏感。因此,我们提出了一种鲁棒的后思考机制,在生成推理依据之前先生成答案。得益于这种答案优先的设置,1)答案可以免受推理依据中微小错误带来的不利影响;2)推理依据充当了答案的错误放大器,这使得小语言模型能够专注于学习困难样本;3)推理效率也能从这种设置中受益,因为在进行推理时,用户可以在答案输出后立即停止生成。然而,尽管后思考机制带来了许多优势并提高了小语言模型在特定任务上的整体性能,但与先思考机制相比,它可能会失去思考问题以及将复杂问题分解为简单子问题的能力。因此,我们借助软提示微调,提出了一种即插即用的自适应思维机制,以整合先思考机制和后思考机制的优势。在该机制中,引入了一个感知模块,用于根据感知到的问题复杂度,自适应地提示小语言模型先回答还是先思考。在12个推理任务和2个代表性语言模型上进行了大量实验,以证明所提机制的有效性。

关键词

引用

@article{arxiv.2404.09170,
  title  = {Distilling Reasoning Ability from Large Language Models with Adaptive Thinking},
  author = {Xiaoshu Chen and Sihang Zhou and Ke Liang and Xinwang Liu},
  journal= {arXiv preprint arXiv:2404.09170},
  year   = {2025}
}

备注

This work has been accepted by IEEE for publication. Early access in IEEE Transactions on Neural Networks and Learning Systems