ROC-n-reroll:验证器不完美如何影响测试时间扩展
机器学习
2025-10-13 v2 机器学习
摘要
测试时间扩展旨在通过在推断时利用额外计算来提高语言模型性能。许多工作经验性地研究了诸如最佳-N (BoN) 和 重采样 (RS) 等技术,这些技术利用验证器来实现测试时间扩展。然而,迄今为止几乎没有理论性地了解验证器不完美如何影响性能——我们在此工作中弥补了这一差距。具体而言,我们证明了这些方法的实例级准确率正式地由验证器 ROC 曲线的几何特征所决定。我们的理论有两个重要含义,通过在 GSM8K 和 MATH500 上的 Qwen 和 LLama 模型实验得到确认。首先,对于固定计算量,RS 在准确率上优于 BoN,而两种方法在无限计算极限下都收敼于相同的准确率。其次,基于低计算情景的观察,一般不可能预测这两种方法在高计算情景下的性能。
引用
@article{arxiv.2507.12399,
title = {ROC-n-reroll: How verifier imperfection affects test-time scaling},
author = {Florian E. Dorner and Yatong Chen and André F. Cruz and Fanny Yang},
journal= {arXiv preprint arXiv:2507.12399},
year = {2025}
}
备注
45 pages, 10 Figures