面向高效链式思考推理的值导向搜索
机器学习
2025-10-01 v2 人工智能
计算与语言
摘要
本文提出一种简单且高效的方法,用于训练长上下文推理痕迹的值模型。与现有的过程奖励模型(PRM)不同,我们的方法不需要对“步骤”进行细粒度的定义,这在面对长上下文推理模型时难以实现。通过收集 250 万条推理痕迹,我们训练了一个 15 亿 token 级的值模型,并将其应用于 DeepSeek 模型,以实现更好的性能和测试时计算扩展。我们发现,块级值导向搜索(VGS)配合最终的加权多数投票,在测试时扩展方面优于标准方法,如多数投票或 best-of-n。此外,VGS 显著减少了实现与多数投票相同性能所需的推理 FLOPs。我们的数据集、模型和代码均已开源。
引用
@article{arxiv.2505.17373,
title = {Value-Guided Search for Efficient Chain-of-Thought Reasoning},
author = {Kaiwen Wang and Jin Peng Zhou and Jonathan Chang and Zhaolin Gao and Nathan Kallus and Kianté Brantley and Wen Sun},
journal= {arXiv preprint arXiv:2505.17373},
year = {2025}
}
备注
NeurIPS 2025