QuasiMoTTo:拟蒙特卡洛测试时扩展
机器学习
2026-07-01 v1 计算与语言
摘要
通过为每个问题生成多个并行尝试来扩展推理计算,是提升语言模型能力的一种昂贵但可靠的手段。默认情况下,这些尝试是独立生成的,将推理计算浪费在冗余解上。这种浪费似乎不可避免。毕竟,正是独立性使得并行采样易于扩展。然而,这种权衡并非本质所在:存在一个丰富的采样器设计空间,能够完全并行地生成相关但精确的样本。我们探索这一设计空间,作为提升推理计算扩展与强化学习(RL)中样本效率的途径。具体而言,我们提出了 QuasiMoTTo,它将相关样本作为独立同分布(i.i.d.)样本的直接替代品。为生成这些样本,QuasiMoTTo 将自回归采样重新参数化为逆 CDF 采样,并使用拟蒙特卡洛(QMC)抽取底层均匀分布;由于 QMC 比 i.i.d. 更均匀地散布均匀分布,所得样本以极少的冗余覆盖输出空间。尽管批次是相关的,但每个样本均按语言模型进行边缘分布,因此我们可以将该批次用于策略梯度训练。我们的实证分析侧重于理解 QuasiMoTTo 能多高效地将计算转化为性能。为评估相关性采样器(其依赖性破坏了标准的 pass@k 估计量),我们首先开发了一种无偏自助估计量。在四个推理基准上,QuasiMoTTo 以减少 25-47% 的样本量匹配了 i.i.d. 的 pass@k 准确率。引人注目的是,QuasiMoTTo 通常能达到任何保持边缘分布的采样器所满足的 pass@k 上界。我们还将 QuasiMoTTo 应用于策略梯度 RL(GRPO),以减少 50% 的训练步数匹配了 i.i.d. 的性能。这些增益源于更高的覆盖率,从而为每个批次产生更强的学习信号。
引用
@article{arxiv.2607.01179,
title = {QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling},
author = {Michael Y. Li and Anthony Zhan and Kanishk Gandhi and Noah D. Goodman and Emily B. Fox},
journal= {arXiv preprint arXiv:2607.01179},
year = {2026}
}