中文

TrajSelector:利用隐式表示实现大规模推理模型的高效有效的最佳-N选择

计算与语言 2025-10-21 v1

摘要

大型语言模型(LLMs)在复杂推理任务中展现出惊人的进步,主要归功于推理期间分配额外计算资源的测试时间扩展(TTS)范式。其中,外部TTS(特别是最佳-N选择范式)通过从多个独立生成的推理轨迹中选择,实现了可扩展的性能提升。然而,这种方法面临关键局限:(i) 部署过程奖励模型的高计算开销,(ii) 低效利用LLM的内在隐式表示。我们引入TrajSelector,一个高效且有效的Best-of-N框架,利用采样LLM中的隐藏状态进行过程级评分。一个轻量级验证器(仅0.6B参数)对每一步轨迹的质量进行评估,然后聚合这些分数以识别最优推理轨迹。我们的框架采用完全数据驱动的、端到端的训练配方,消除了对大量逐步级标注的依赖。跨越五个基准的实验结果表明,TrajSelector持续提供性能提升。在Best-of-32设置下,它将准确率提升4.61%,并超过现有的过程奖励模型提升4.31%至12.21%,同时保持更低的推理成本。

关键词

引用

@article{arxiv.2510.16449,
  title  = {TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model},
  author = {Bin Yu and Xinming Wang and Shijie Lian and Haotian Li and Changti Wu and Ruina Hu and Bailing Wang and Yuliang Wei and Kai Chen},
  journal= {arXiv preprint arXiv:2510.16449},
  year   = {2025}
}

备注

13 pages, 6 figures. Project website: https://zgca-ai4edu.github.io/TrajSelector