面向最佳-N抽样的推理感知微调
计算与语言
2025-11-27 v2 人工智能
机器学习
摘要
最近的研究表明,有效利用推理时间计算对于获得大型语言模型(LLM)的更好性能至关重要。本文提出了一种新颖的推理感知微调范式,即以直接优化推理时间策略性能的方式进行模型微调。我们使用简单而有效的“从-N中挑选最佳”(Best-of-N, BoN)推理策略进行了该范式的研究,即验证器从一组LLM生成的响应中选择最佳响应。我们设计了首个针对BoN感知微调的模仿学习和强化学习(RL)方法,克服了BoN中非可微的argmax算子。我们实证证明,BoN感知模型会隐式学习一种元策略,即交叉挑选最佳响应以及更具多样性的响应以适应测试时间输入——一种类似于RL中探索-开发权衡的过程。我们的实验表明,BoN感知微调在性能和推理时间计算方面均显示出效用。具体而言,我们显示本方法将Gemma 2B在Hendrycks MATH上的Bo32性能从26.8%提升至30.8%,pass@32从60.0%提升至67.0%,以及HumanEval上的pass@16从61.6%提升至67.1%。
关键词
引用
@article{arxiv.2412.15287,
title = {Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models},
author = {Yinlam Chow and Guy Tennenholtz and Izzeddin Gur and Vincent Zhuang and Bo Dai and Sridhar Thiagarajan and Craig Boutilier and Rishabh Agarwal and Aviral Kumar and Aleksandra Faust},
journal= {arXiv preprint arXiv:2412.15287},
year = {2025}
}