通过元强化微调优化测试时计算
机器学习
2025-03-11 v1 人工智能
计算与语言
摘要
训练模型以有效利用测试时计算对于提升 LLM 的推理性能至关重要。当前方法大多通过在搜索轨迹上进行微调或使用 0/1 结果奖励运行 RL 来实现这一点,但这些方法是否有效利用了测试时计算?随着预算增加,这些方法能否继续扩展?在本文中,我们尝试回答这些问题。我们将优化测试时计算的问题形式化为元强化学习(RL)问题,这为分配测试时计算提供了原则性视角。该视角使我们能够将 LLM 的长输出流视为在测试时运行的多个片段,并引导我们使用输出 token 上的累积遗憾概念来衡量测试时计算的有效性。类似于 RL 算法在训练中能够最佳权衡探索与利用,最小化累积遗憾也将在 token 流中提供探索与利用之间的最佳平衡。虽然我们表明最先进的模型并未最小化遗憾,但可以通过在 0/1 结果奖励 RL 的基础上最大化密集奖励奖金来实现这一点。该奖金是输出流中每个后续块所取得的“进展”,由最终成功似然的变化来量化。基于这些洞察,我们开发了元强化微调(MRT),一类用于优化测试时计算的微调新方法。与结果奖励 RL 相比,MRT 在数学推理上实现了 2-3 倍的相对性能提升和约 1.5 倍的 token 效率提升。
引用
@article{arxiv.2503.07572,
title = {Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning},
author = {Yuxiao Qu and Matthew Y. R. Yang and Amrith Setlur and Lewis Tunstall and Edward Emanuel Beeching and Ruslan Salakhutdinov and Aviral Kumar},
journal= {arXiv preprint arXiv:2503.07572},
year = {2025}
}