中文

Rollout Roulette:一种利用基于粒子的蒙特卡洛方法对大型语言模型进行推理时扩展的概率推断方法

机器学习 2025-08-15 v5 人工智能

摘要

大型语言模型(LLMs)通过扩大模型规模和/或数据量取得了显著的性能提升。然而,最近的证据表明,这种方法的回报正在递减,这促使人们扩展推理时花费的计算量。现有的推理时扩展方法,通常使用奖励模型,将任务视为一个搜索问题,这往往容易因奖励模型中的近似误差而受到奖励黑客攻击。在本文中,我们将推理时扩展视为一个概率推断任务,并利用基于采样的技术来探索具有近似似然的状态空间模型的状态分布的典型集,而不是直接优化其模式。我们通过将基于粒子的蒙特卡洛方法应用于此任务,提出了一种新颖的推理时扩展方法。我们的实证评估表明,在各种具有挑战性的数学推理任务上,我们的方法比确定性搜索对应方法具有 4-16 倍的更优扩展率。使用我们的方法,我们证明 Qwen2.5-Math-1.5B-Instruct 仅需 4 次 rollout 即可超越 GPT-4o 的准确率,而 Qwen2.5-Math-7B-Instruct 仅需 32 次 rollout 即可扩展到 o1 级别的准确率。我们的工作不仅提出了一种有效的推理时扩展方法,还将丰富的概率推断文献与大型语言模型的推理时扩展联系起来,以便在未来的工作中开发更鲁棒的算法。代码、视频和更多信息可在 https://probabilistic-inference-scaling.github.io 获取。

关键词

引用

@article{arxiv.2502.01618,
  title  = {Rollout Roulette: A Probabilistic Inference Approach to Inference-Time Scaling of LLMs using Particle-Based Monte Carlo Methods},
  author = {Isha Puri and Shivchander Sudalairaj and Guangxuan Xu and Kai Xu and Akash Srivastava},
  journal= {arXiv preprint arXiv:2502.01618},
  year   = {2025}
}