中文

通过小规模偏好优化削减大规模推理模型的长链式思维

人工智能 2026-04-16 v2

摘要

最近的大规模推理模型 (LRM) 进展表明,通过长链式思维 (CoT) 推理在复杂任务上表现出强大的性能。然而,这些冗长的输出增加了计算成本,可能导致过度思考,这在在推理效果和效率之间寻求平衡方面提出了挑战。当前的解决方案往往妥协推理质量,或需要大量资源。在本文中,我们研究如何在有限调谋条件下缩短 LRM 的生成长度。我们分析生成路径分布并通过难度估计筛选生成轨迹。随后,我们在基于统一Bradley-Terry损失的框架下分析各种偏好优化目标的收敛特性。基于上述分析,我们提出了长度控制偏好优化 (Length Controlled Preference Optimization, LCPO),该方法直接平衡与NLL损失相关的隐式奖励。LCPO能够在有限数据和训练下有效学习长度偏好。大量实验表明,我们的方法在多个基准测试中将 LRM 的平均输出长度显著减少超过50%,同时保持推理性能。我们的工作凸显了在引导 LRM 高效推理方面具有计算效率潜力的方法。

关键词

引用

@article{arxiv.2508.10164,
  title  = {Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization},
  author = {Bin Hong and Jiayu Liu and Kai Zhang and Jianwen Sun and Mengdi Zhang and Zhenya Huang},
  journal= {arXiv preprint arXiv:2508.10164},
  year   = {2026}
}

备注

26 pages, 8 figures, ICLR'26