中文

GenSelect:面向最佳N选取的最佳生成方法

机器学习 2025-07-25 v1 计算与语言

摘要

基于并行采样的生成式奖励模型已为推理任务实现了有效的测试时扩展。当前方法采用对单个解答的评分或两两比较。然而,点评方法未充分利用LLM的比较能力,而两两比较方法随采样预算的增大而扩展效率低下。我们引入GenSelect,LLM利用长推理过程在N个备选解中选取最佳解答。这充分利用了LLM的比较优势,同时在并行采样预算上实现了高效扩展。对于数学推理,我们展示,推理模型(如QwQ和DeepSeek-R1-0528)在GenSelect方面表现出色,凭简单提示即可超越现有评分方法。

关键词

引用

@article{arxiv.2507.17797,
  title  = {GenSelect: A Generative Approach to Best-of-N},
  author = {Shubham Toshniwal and Ivan Sorokin and Aleksander Ficek and Ivan Moshkov and Igor Gitman},
  journal= {arXiv preprint arXiv:2507.17797},
  year   = {2025}
}

备注

Presented at the 2nd AI for MATH Workshop @ ICML