中文

最大化前缀置信度在测试时高效提升数学推理

机器学习 2025-07-25 v1

摘要

最近的研究表明,语言模型可通过最大化自身预测置信度来实现自我改进,而无需依赖外部验证器或奖励信号。在本工作中,我们研究了语言模型在数学推理任务中的测试时扩展,其中模型自身的置信度用于选择最有前景的尝试。令人惊讶的是,我们发现仅通过按模型前缀置信度所选取的最有前景的尝试即可实现显著的性能提升。我们在五个数学推理数据集上系统评估了前缀置信度扩展:学校水平的 GSM8K 和 MATH500,以及竞赛水平的 AMC23、AIME24 和 AIME25。我们发现,前缀置信度扩展使用仅32个前缀的前缀即可实现比多数投票更好的准确率-计算权衡。此外,前缀置信度扩展似乎比 BoN 更不易受长度偏见的影响。最后,我们也评估了带前缀置信度的测试时训练,发现虽然优于基础模型,却不如前缀置信度扩展。

关键词

引用

@article{arxiv.2507.18122,
  title  = {Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning},
  author = {Matthias Otth and Jonas Hübotter and Ido Hakimi and Andreas Krause},
  journal= {arXiv preprint arXiv:2507.18122},
  year   = {2025}
}