中文

推理计算尺度理论:通过有向随机技能搜索进行推理

机器学习 2025-07-11 v2 人工智能 计算机与社会 性能

摘要

大语言模型(LLM)在训练和部署期间需要大量计算、能源和财政资源。虽然训练规模定律指导了该领域近期的众多进步,但推理成本现在已成为整体资源负担的显著且不断增长的组成部分,特别是针对注重推理的模型。现有的计算最优性表征要么考虑模型大小、数据集大小和推理标记的独立性,要么以固定组合形式考虑,可能忽略更高效的运行点。我们引入有向随机技能搜索(DS3),这是一种通用的框架,将推理表示为在已学习技能图上的随机遍历。从一个简化而又具有表达力的实例出发,我们推导出任务成功率和计算成本的闭式表达式,覆盖广泛的推理策略,包括链式思考(CoT)和树状思考(ToT),enable 比较分析,依据任务难度和模型能力。为此,我们扩展了此前基于第一性原理的 LLM 训练三元图框架,以纳入推理,并分别将 DS3 与描述 LLM 规模行为的经验方法相桥接。我们在理论上恢复了经验观察到的模式,包括:准确率随计算资源呈对数增长而线性提升;不同任务难度和模型能力下的首选推理策略存在差异;即使在参数规模下性能平台期,推理也能引发显现行为;以及最佳-N(BoN)和多数投票行为在统一的分析框架中得到捕获。通过显式表征训练-推理之间的相互依赖,本框架深化了理论理解,支持原则性的算法设计和资源分配。

关键词

引用

@article{arxiv.2507.00004,
  title  = {A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search},
  author = {Austin R. Ellis-Mohr and Anuj K. Nayak and Lav R. Varshney},
  journal= {arXiv preprint arXiv:2507.00004},
  year   = {2025}
}