测试时计算的战略扩展:多臂赌博机学习方法
人工智能
2026-04-24 v2 计算与语言
机器学习
机器学习
摘要
扩展测试时计算已成为提升大语言模型性能的有效策略。然而,现有方法通常对所有查询均匀分配计算,忽略了查询难度的差异。为解决这一低效问题,我们将测试时计算分配建模为一个新颖的多臂赌博机学习问题,并提出能够在线估计查询难度并相应分配计算的自适应算法。与均匀分配相比,我们的算法将更多计算分配给困难查询,同时保持对简单查询的准确性。在困难查询中,我们的算法进一步学会优先处理可求解实例,有效减少对不可求解查询的过度计算。我们从理论上证明了算法相比均匀分配具有更好的计算效率,并在数学和代码基准上实证验证了其有效性。具体而言,我们的算法在MATH-500数据集上实现了最高11.10%的性能提升(相对提升15.04%),在AIME25数据集上实现了最高10.82%(相对提升14.44%),在LiveCodeBench数据集上实现了最高11.23%的性能提升(相对提升15.29%)。
引用
@article{arxiv.2506.12721,
title = {Strategic Scaling of Test-Time Compute: A Bandit Learning Approach},
author = {Bowen Zuo and Yinglun Zhu},
journal= {arXiv preprint arXiv:2506.12721},
year = {2026}
}
备注
To appear at ICLR 2026