中文

SCATR: Simple Calibrated Test-Time Ranking

机器学习 2026-04-22 v2 人工智能

摘要

测试时计算(Test-Time Scaling, TTS)通过在推理时分配额外计算资源来提高大型语言模型(LLM)性能。在实际应用中,TTS 通常通过并行扩展实现:生成多个候选响应并通过 Best-of-N(BoN)策略选择最佳者。其有效性因此取决于评分函数。经过训练的评分器(如过程奖励模型,PRM)可能性能较好,但训练和运行成本较高。基于 token 对数概率的轻量级置信度启发式方法则更便宜,但我们发现它们往往性能 substantially 更差。为改进轻量级置信度启发式而不付出强学习评分器的全部成本,我们引入 SCATR,这是一种简单且高效的 BoN 排序方法,通过从小型校准集利用基础模型的隐藏表示学习轻量级评分器。跨编码和数学推理基准测试,SCATR 相对于先前基于置信度的基线提升最高可达 9%。相对于同一校准数据上的 LoRA 微调,SCATR 在相同精度下所需参数最高可减少 8000 倍,计算成本大幅降低,训练和推理延迟分别降低最高可达 150 倍和 1000 倍。SCATR 也与强大的 PRM 基线相当且在多个场景下在数学和编码任务中分别提升最高可达 7.8% 和 4.2%,同时实现最快 1000 倍的推理速度。总体而言,SCATR 在可扩展的测试时选择方面提供了强大的精度-效率权衡。

关键词

引用

@article{arxiv.2604.16535,
  title  = {SCATR: Simple Calibrated Test-Time Ranking},
  author = {Divya Shyamal and Marta Knežević and Lan Tran and Chanakya Ekbote and Vijay Lingam and Paul Pu Liang},
  journal= {arXiv preprint arXiv:2604.16535},
  year   = {2026}
}