更多测试时计算可能有害:LLM束搜索中的高估偏差
机器学习
2026-03-18 v2 人工智能
摘要
更宽的束搜索应该改善LLM推理,但何时应该停止加宽?先前关于束宽选择的工作侧重于推理效率,未分析更宽的搜索是否会损害输出质量。我们提出了一种基于极值理论的分析来回答这个问题。在噪声评分器输出上的束选择引入了一个随候选池大小增长的系统性高估偏差,我们推导出一个最大有效束宽 ,超过该宽度搜索会降低性能。这一关键宽度取决于评分器的信噪比: 随 指数增长,其中 是正确路径相对于错误路径的质量优势, 是评分器噪声。我们通过在MR-BEN(5,975个问题)上对三个7B参数模型和十个领域比较困惑度引导和PRM引导的束搜索来验证这一理论。困惑度评分由于其高噪声,得出 :在任何测试宽度下搜索均无益处。PRM评分由于噪声较低,得出 ,增益高达8.9个百分点。同一模型、同一算法,但不同评分器将 置于束宽范围的两端。我们的分析识别出评分器的信噪比是控制束宽选择的关键量,并提出了实践中选择束宽的诊断指标。
引用
@article{arxiv.2603.15377,
title = {More Test-Time Compute Can Hurt: Overestimation Bias in LLM Beam Search},
author = {Gal Dalal and Assaf Hallak and Gal Chechik and Yftah Ziser},
journal= {arXiv preprint arXiv:2603.15377},
year = {2026}
}