中文

数学推理中验证器引导搜索的扩展缺陷

计算与语言 2025-02-04 v1

摘要

大型语言模型(LLMs)在多步推理方面存在困难,而推理时扩展已成为一种有前景的性能提升策略。当样本量有限时,验证器引导搜索通过选择和优先处理有效推理路径,其表现优于重复采样。然而,我们发现了一个关键限制:扩展缺陷,这在不同的模型(Mistral 7B 和 DeepSeekMath 7B)、基准测试(GSM8K 和 MATH)以及验证器(结果价值模型和过程奖励模型)中普遍存在。随着样本量的增加,验证器引导搜索的优势递减,并最终表现不如重复采样。我们的分析将此归因于验证器失效,即不完美的验证器错误地对候选方案进行排序,并错误地剪枝掉所有有效路径。这些问题在具有挑战性和分布外的问题中进一步加剧,限制了搜索的有效性。为了缓解验证器失效,我们探索了减少对验证器的依赖,并使用两种简单方法进行了初步研究。我们的发现揭示了验证器引导搜索的根本局限性,并指出了未来的方向。

关键词

引用

@article{arxiv.2502.00271,
  title  = {Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning},
  author = {Fei Yu and Yingru Li and Benyou Wang},
  journal= {arXiv preprint arXiv:2502.00271},
  year   = {2025}
}