中文

面向LLM推理的最优测试时计算扩展策略

计算与语言 2025-10-14 v2 人工智能

摘要

近期研究表明,让模型花更多时间通过更长的思维链进行思考,可以在复杂推理任务中获得显著提升。虽然当前研究持续探索通过扩展大语言模型(LLM)的思维链长度来增加测试时计算的好处,但我们关注当前测试时扩展追求背后隐藏的一个潜在问题:过度扩展思维链长度是否会对模型的推理性能产生不利影响?我们在数学推理任务上的探索揭示了一个意外发现:在某些领域,更长的思维链扩展确实会损害LLM的推理性能。此外,我们发现存在一个最优的扩展长度分布,且不同领域之间存在差异。基于这些洞察,我们提出了一种最优思维扩展(Thinking-Optimal Scaling)策略。我们的方法首先使用一组具有不同响应长度分布的少量种子数据来教导模型在不同推理努力下采用不同的推理投入。然后,模型在不同推理努力下针对额外问题选择最短的正确响应进行自我提升。基于Qwen2.5-32B-Instruct构建的自我提升模型在各种数学基准测试中优于其他基于蒸馏的32B o1类模型,并达到了产生种子数据的教师模型QwQ-32B-Preview的性能水平。

关键词

引用

@article{arxiv.2502.18080,
  title  = {Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning},
  author = {Wenkai Yang and Shuming Ma and Yankai Lin and Furu Wei},
  journal= {arXiv preprint arXiv:2502.18080},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025, camera-ready version