中文

睡眠时间计算:超越测试时推理标度

人工智能 2025-04-18 v1 计算与语言

摘要

扩大测试时计算量已成为启用大型语言模型(LLM)解决困难问题的关键要素,但伴随高延迟和推理成本。我们提出睡眠时间计算(sleep-time compute)技术,使模型能够在查询呈现前“离线思考”上下文:通过预见用户可能提出的查询并预先计算有用量,可显著降低测试时的计算需求。为证明该方法有效性,我们创建了两个推理任务的修改版本——带状态GSM-Symbolic和带状态AIME。我们发现,睡眠时间计算可将实现相同准确率所需的测试时计算量约减50%。此外,通过规模化睡眠时间计算,我们可在带状态GSM-Symbolic上提升准确率最高达13%,在带状态AIME上提升最高达18%。进一步,我们引入多查询GSM-Symbolic,该方法在单个上下文中包含多个相关查询。通过在Multi-Query GSM-Symbolic下对同一上下文的相关查询实现睡眠时间计算摊销,可将平均查询成本降低2.5倍。我们随后进行额外分析,了解睡眠时间计算何时最为有效,发现用户查询可预测性与睡眠时间计算有效性高度相关。最后,我们对睡眠时间计算应用于真实代理人软件工程任务进行了案例研究。

关键词

引用

@article{arxiv.2504.13171,
  title  = {Sleep-time Compute: Beyond Inference Scaling at Test-time},
  author = {Kevin Lin and Charlie Snell and Yu Wang and Charles Packer and Sarah Wooders and Ion Stoica and Joseph E. Gonzalez},
  journal= {arXiv preprint arXiv:2504.13171},
  year   = {2025}
}

备注

Code and data released at: https://github.com/letta-ai/sleep-time-compute