中文

CarBoN:校准最佳-N采样提高测试时推理

机器学习 2025-10-20 v1 人工智能

摘要

在推理时间(测试时)分配更多计算资源可提升语言模型性能,尤其是针对推理任务。然而,诸如最佳-N采样等流行方法随着N的增加往往显示报酬递减。为解决这种效率问题,我们引入了一个通用的测试时校准框架,能够适应性地修改模型以针对高奖励推理路径进行校准,理论上保证在有限抽样下提高预期奖励下界,且无需大规模语言模型(LLM)重新训练。在该框架内,我们提出了CarBoN(Calibrated Best-of-N),这是一种两阶段方法,首先探索解空间,然后通过输入特定的温度TT和加法偏移向量δ\delta学习校准,以引导生成更可靠的推理。在MATH-500和AIME-2024上的实验表明,CarBoN在效率方面取得了改进,最多可减少4倍的抽样次数以达到相同的准确率,同时在固定预算下常常实现更高的准确率。我们还分析了TTδ\delta在平衡输出多样性和正确性方面的互补作用,证明该框架也适用于诸如beam search等的分步采样策略。欲了解更多信息,请参阅我们的项目页面位于huggingface.co/spaces/TrustSafeAI/Test-Time-Calibration。

关键词

引用

@article{arxiv.2510.15674,
  title  = {CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning},
  author = {Yung-Chen Tang and Pin-Yu Chen and Andrea Cavallaro},
  journal= {arXiv preprint arXiv:2510.15674},
  year   = {2025}
}