中文

TwT:基于多教师引导的习惯性推理蒸馏实现无Token思考

计算与语言 2025-11-05 v2

摘要

大型语言模型(LLM)通过引入推理过程在问题求解方面取得了显著进展。然而,这种增强的推理能力会导致推理过程中输出Token数量增加,从而带来更高的计算成本。为应对这一挑战,我们提出了 TwT(Thinking without Tokens,无Token思考),一种通过多教师引导的习惯性推理蒸馏来降低推理时成本,同时保持高性能的方法。我们的方法引入了习惯性推理蒸馏方法,该方法受人类认知启发,通过教师引导的压缩策略将显式推理内化为模型的习惯性行为。此外,我们提出了双准则拒绝采样(Dual-Criteria Rejection Sampling, DCRS),该技术利用多个教师模型生成高质量且多样化的蒸馏数据集,使我们的方法适用于无监督场景。实验结果表明,TwT 在减少输出Token数量的同时保持了优异的性能,与其他蒸馏方法相比准确率最高提升 13.6%,为高效的 LLM 部署提供了极具实用性的解决方案。

关键词

引用

@article{arxiv.2503.24198,
  title  = {TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers' Guidance},
  author = {Jingxian Xu and Mengyu Zhou and Weichang Liu and Hanbing Liu and Shi Han and Dongmei Zhang},
  journal= {arXiv preprint arXiv:2503.24198},
  year   = {2025}
}