面向提升大型语言模型数学问题解决能力的 Token 监督价值模型
计算与语言
2025-03-11 v2 人工智能
摘要
随着基于测试时计算搜索策略的快速发展以提高大型语言模型(LLM)的数学问题解决能力,构建稳健的验证器需求日益增长。然而,所有这些推理策略都依赖最初为 Best-of-N 搜索设计的现有验证器,导致其在测试时树形搜索技术上次优。树形搜索期间,现有验证器只能提供部分解决方案或对前景中间步骤的间接和隐式评估,从而导致有前景的中间步骤被过早修剪。为克服这些限制,我们提出了 token 监督价值模型(TVMs)——一种新的验证器类别,对每个 token 分配概率,以反映到达正确最终答案的可能性。这种新的 token 级监督使 TVMs 能够在测试时树形搜索中直接且明确地评估部分解决方案,有效区分有前景和不正确的中间步骤。实验结果表明,将基于树形搜索的推理策略与 TVMs 结合显著提高了 LLM 在数学问题解决任务中的准确率,超越了现有验证器的性能。
引用
@article{arxiv.2407.12863,
title = {Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models},
author = {Jung Hyun Lee and June Yong Yang and Byeongho Heo and Dongyoon Han and Kyungsu Kim and Eunho Yang and Kang Min Yoo},
journal= {arXiv preprint arXiv:2407.12863},
year = {2025}
}