中文

ROC-n-reroll:验证器不完美如何影响测试时间扩展

机器学习 2025-10-13 v2 机器学习

摘要

测试时间扩展旨在通过在推断时利用额外计算来提高语言模型性能。许多工作经验性地研究了诸如最佳-N (BoN) 和 重采样 (RS) 等技术,这些技术利用验证器来实现测试时间扩展。然而,迄今为止几乎没有理论性地了解验证器不完美如何影响性能——我们在此工作中弥补了这一差距。具体而言,我们证明了这些方法的实例级准确率正式地由验证器 ROC 曲线的几何特征所决定。我们的理论有两个重要含义,通过在 GSM8K 和 MATH500 上的 Qwen 和 LLama 模型实验得到确认。首先,对于固定计算量,RS 在准确率上优于 BoN,而两种方法在无限计算极限下都收敼于相同的准确率。其次,基于低计算情景的观察,一般不可能预测这两种方法在高计算情景下的性能。

关键词

引用

@article{arxiv.2507.12399,
  title  = {ROC-n-reroll: How verifier imperfection affects test-time scaling},
  author = {Florian E. Dorner and Yatong Chen and André F. Cruz and Fanny Yang},
  journal= {arXiv preprint arXiv:2507.12399},
  year   = {2025}
}

备注

45 pages, 10 Figures