中文

Guided by Gut:基于强化内在置信度的高效测试时扩展

计算与语言 2025-05-28 v1 人工智能

摘要

用于增强大型语言模型 (LLM) 推理的测试时扩展 (TTS) 方法通常会产生大量的计算成本,这主要归因于对外部过程奖励模型 (PRM) 或诸如 Best-of-N (BoN) 等采样方法的严重依赖。本文提出了 Guided by Gut (GG),这是一个高效的自引导 TTS 框架,无需昂贵的外部验证模型即可达到 PRM 级别的性能。我们的方法采用仅由内在 LLM 信号(即 token 级置信度和步骤新颖性)引导的轻量级树搜索。一项关键创新是通过有针对性的强化学习微调阶段来提高内部置信度估计的可靠性。在具有挑战性的数学推理基准上的经验评估表明,GG 使较小的模型(例如 1.5B 参数)能够达到匹配或超越显著更大的模型(例如 32B-70B 参数)的准确率,同时将 GPU 内存使用量减少高达 10 倍。与基于 PRM 的方法相比,GG 实现了相当的准确率,推理速度提高 8 倍,内存使用量降低 4-5 倍。此外,与 BoN 策略相比,GG 将 KV 缓存内存使用量减少了约 50%,从而促进了 TTS 技术更高效、更实用的部署。

关键词

引用

@article{arxiv.2505.20325,
  title  = {Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence},
  author = {Amirhosein Ghasemabadi and Keith G. Mills and Baochun Li and Di Niu},
  journal= {arXiv preprint arXiv:2505.20325},
  year   = {2025}
}