中文

大语言模型测试时计算的规模之艺

计算与语言 2025-12-02 v1

摘要

测试时规模 (TTS) ——即在推理期间动态分配计算资源——是提高大语言模型 (LLM) 推理能力的有前景的方向。然而,缺乏在相同条件下对众多 TTS 策略进行系统比较,以及模型类型和问题难度对性能的影响仍不明确。为填补这一空白,我们进行了首次大规模 TTS 研究,涵盖超过三十亿个生成的 token,使用八个开源 LLM(参数规模从 7B 到 235B),跨越四个推理数据集。我们观察到三个持续的趋势:(1) 没有单一的 TTS 策略在所有情况下都占据优势;(2) 推理模型在问题难度和轨迹长度上呈现出不同的 trace-quality 模式,形成短视角和长视角类别;(3) 对于给定的模型类型,最优的 TTS 性能随计算预算的单调递增。基于这些发现,我们提供了实用的方法论,用于选择最佳的 TTS 策略,考虑问题难度、模型类型和计算预算,为有效的推理时间规模提供实用指南。

关键词

引用

@article{arxiv.2512.02008,
  title  = {The Art of Scaling Test-Time Compute for Large Language Models},
  author = {Aradhye Agarwal and Ayan Sengupta and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2512.02008},
  year   = {2025}
}