中文

探究无验证器推理时间扩展方法的效率:深入分析

人工智能 2025-04-22 v1

摘要

人们对如何利用推理时间计算 (ITC) (例如重复抽样、细化等) 来提高大型语言模型 (LLM) 能力持续感兴趣。同时,Deepseek-R1 等推理模型的突破为利用强化学习提高 LLM 推理技能开辟了机遇。深入了解 ITC 如何与推理在不同模型之间交互,可能为进一步推动 LLM 前沿提供重要指导。本工作对推理时间扩展方法进行了全面分析,针对具有挑战性推理任务中的推理模型和非推理模型。具体而言,我们专注于由于无需奖励模型即可实现的普遍性而进行研究的无验证器推理时间扩展方法。我们构建了质量与效率的帕累托前沿。我们发现,即使在极高的推理预算下,非推理模型仍显著落后于推理模型。对于推理模型,多数投票被证明是稳健的推理策略,通常与更复杂的 ITC 方法如 best-of-N 和顺序修订相竞争或甚至优于,而额外的推理计算提供的改进极小。我们进一步对关键响应特征 (长度和语言标记) 与响应质量之间的关联进行深入分析,通过该分析可改进现有的 ITC 方法。我们发现,来自推理模型的正确响应通常较短,且包含较少的迷倦和思考标记 (但更多的话语标记)。

关键词

引用

@article{arxiv.2504.14047,
  title  = {Think Deep, Think Fast: Investigating Efficiency of Verifier-free Inference-time-scaling Methods},
  author = {Junlin Wang and Shang Zhu and Jon Saad-Falcon and Ben Athiwaratkun and Qingyang Wu and Jue Wang and Shuaiwen Leon Song and Ce Zhang and Bhuwan Dhingra and James Zou},
  journal= {arXiv preprint arXiv:2504.14047},
  year   = {2025}
}