超越前沿:高效测试时间扩展的随机回溯
人工智能
2026-05-26 v1 机器学习
摘要
测试时间扩展通过增加计算资源来探索多个解决方案轨迹,从而提高语言模型的推理能力。关键挑战在于最大化准确率的同时最小化生成令牌的总数。在最近的 PRM 指导方法中,得分用于引导此类搜索,但大多数方法仅针对当前活动前缀进行前沿处理,利用噪声的 PRM 分数不可逆地修剪或重新采样其余部分。这可能导致早期承诺、多样性丧失以及仍可能产生正确连续片段的前缀被遗弃。我们引入了基于持久历史前缀池的随机回溯,允许测试时间计算回顾以前生成的状态而不仅仅是扩展当前前沿。为提高效率,我们提出了两种互补机制。子池选择通过在随机子池内应用 Top-N 选择来强化贪心 PRM 指导搜索,赋予历史前缀机会规避得分过高的前沿候选人。Power Backtrack 序列蒙特卡罗方法将 SMC 风格的抽样扩展到持久池中,使用提升的 PRM 分数和混合校正权重。我们的方法在数学推理基准和模型规模方面始终实现更高的每令牌准确率,并且在与强大的 PRM 指导基线相当的准确率下,只需使用更小的令牌计数即可实现相同水平的准确率,表明持久池随机回溯为测试时间扩展的准确率-令牌权衡提供了一种简单且有效的方法。
引用
@article{arxiv.2605.25143,
title = {Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling},
author = {Dao Tran and Duc Anh Le and Ngoc Luu and Quan Pham and Tung Pham and Hung Bui},
journal= {arXiv preprint arXiv:2605.25143},
year = {2026}
}