中文

简洁推理,巨大收益:结合难度感知提示来修剪长推理轨迹

人工智能 2025-05-27 v1

摘要

现有的思维链蒸馏方法能够有效地将推理能力迁移至基础模型,但存在两大主要局限:推理轨迹过于冗长,以及对问题难度的适应性不足。冗长的推理轨迹显著增加了推理成本,而统一长度的解决方案阻碍了基础模型学习自适应的推理策略。为了解决这些问题,我们提出了一种难度感知提示方法,在不损失性能的前提下动态缩短推理轨迹。在我们的方法中,大型教师模型首先判断每个问题的难度,随后将其推理轨迹重写为适当的较短长度,从而产生简洁而完整的推理轨迹。借助 DAP 流程,我们构建了一个名为 LiteCoT 的蒸馏数据集,包含 10 万个简洁推理样本,其解答平均仅包含 720 个 token(比典型 CoT 短一个数量级)。我们使用 LiteCoT 基于 Qwen2.5 架构蒸馏出一个名为 Liter(1.5B、7B 和 32B)的全新推理模型家族。实验表明,仅在这 10 万个经过难度修剪的 CoT 样本上微调的学生模型,其性能优于在 80 万个原始长 CoT 样本上蒸馏的模型,同时显著降低了训练与推理成本。我们的方法也展现出良好的泛化能力:在 11 个多样化的基准测试中,较短的难度感知 CoT 使用更少的 token 取得了与长链相当甚至更好的准确率。例如,在极具挑战性的 AIME24 考试中,我们的方法仅使用约 5K 推理 token 即达到了 74.2%74.2\% 的 Pass@1,超越了消耗更多 token 的其他方法。我们的代码与数据可在 https://github.com/Evanwu1125/LiteCoT 获取。

关键词

引用

@article{arxiv.2505.19716,
  title  = {Concise Reasoning, Big Gains: Pruning Long Reasoning Trace with Difficulty-Aware Prompting},
  author = {Yifan Wu and Jingze Shi and Bingheng Wu and Jiayi Zhang and Xiaotian Lin and Nan Tang and Yuyu Luo},
  journal= {arXiv preprint arXiv:2505.19716},
  year   = {2025}
}