通过思维训练与无思维推理实现高效推理
计算与语言
2025-12-01 v3
摘要
大型语言模型的最新进展利用显式的思维链提示来提高推理准确性。然而,现有方法主要侧重于压缩冗长的推理输出。这些“长到短”的转换旨在提高效率,但需要大量短的CoT数据。在这项工作中,我们引入了\textbf{3TF}(\textbf{T}hought-\textbf{T}raining and \textbf{T}hought-\textbf{F}ree inference,思维训练与无思维推理),一个从“短到长”视角出发的高效推理框架。我们首先训练一个可以在推理和非推理模式下运行的混合模型,然后进一步在CoT标注数据上训练它以内化结构化推理,同时在推理时使用非推理模式强制生成简洁、无思维链的输出。与基于压缩的方法不同,3TF提高了非推理输出的推理质量,使模型能够隐式地执行丰富的内部推理,同时保持外部输出简短。实验表明,经过3TF训练的模型在无思维链推理下的推理基准测试中取得了巨大进步,证明了高质量的推理可以在没有显式逐步生成的情况下被隐式学习和执行。
引用
@article{arxiv.2511.03408,
title = {Efficient Reasoning via Thought-Training and Thought-Free Inference},
author = {Canhui Wu and Qiong Cao and Chao Xue and Wei Xi and Xiaodong He},
journal= {arXiv preprint arXiv:2511.03408},
year = {2025}
}
备注
11 pages, 4 figures