请勿浪费您的 rollout:循环搜索经验以提高测试时扩展效率
计算与语言
2026-05-06 v2 机器学习
摘要
测试时扩展通过分配额外的推理计算来扩大解空间探索,从而提升大语言模型的推理能力。然而,现有搜索策略通常将 rollout 视为可丢弃的样本,其中宝贵的中间见解在每次尝试后即被丢弃。这种浪费的 rollout 级别经验导致计算冗余,模型在大量尝试中反复重新推导已发现的结论并回访已知死胞同路。为弥合这一差距,我们提出了循环搜索经验(RSE),一种自指导、无需训练的策略,将测试时搜索从一系列孤立试验转化为基于经验的累积过程。通过积极将原始轨迹提炼为共享经验库,RSE 实现了对中间结论的正向循环,以缩短冗余推导,并对失败模式进行负向循环,以修剪遇到的死胞同路。理论上,我们提供了分析,将 RSE 在解决复杂推理任务时的效率优势形式化。实验方面,针对 HMMT24、HMMT25、IMO-Bench 和 HLE 的广泛实验表明,RSE 在可比计算预算下始终优于强大基线,为测试时扩展树立了强大的计算效率前沿。
关键词
引用
@article{arxiv.2601.21684,
title = {Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling},
author = {Xinglin Wang and Jiayi Shi and Shaoxiong Feng and Peiwen Yuan and Yiwei Li and Yueqi Zhang and Chuyi Tan and Ji Zhang and Boyuan Pan and Yao Hu and Kan Li},
journal= {arXiv preprint arXiv:2601.21684},
year = {2026}
}
备注
preprint