面向 LLM 推理的基于结果的探索
机器学习
2025-09-09 v1 计算与语言
摘要
强化学习(RL)已成为提升大型语言模型(LLM)推理能力的强大方法。基于结果的 RL 仅根据最终答案的正确性奖励策略,带来了显著的准确率提升,但也导致了生成多样性的系统性损失。这种崩溃损害了现实世界性能,其中多样性对于测试时扩展至关重要。我们通过将 RL 后训练视为采样过程来分析这一现象,并表明令人惊讶的是,相对于基础模型,RL 甚至在训练集上也会降低有效多样性。我们的研究强调了两个核心发现:(i)多样性退化的转移,即已解决问题上减少的多样性会传播到未解决问题上;以及(ii)结果空间的可处理性,因为推理任务仅允许有限的不同答案集合。受这些见解启发,我们提出了基于结果的探索,根据最终结果分配探索奖励。我们引入了两种互补算法:历史探索,通过 UCB 风格的奖励鼓励罕见观察到的答案;以及批探索,惩罚批内重复以促进测试时多样性。在标准竞赛数学上使用 Llama 和 Qwen 模型的实验表明,这两种方法都提高了准确率,同时缓解了多样性崩溃。在理论方面,我们通过基于结果的赌臂机新模型形式化了基于结果探索的益处。这些贡献共同描绘了一条实用路径,指向在不牺牲可扩展部署所必需的多样性的情况下增强推理的 RL 方法。
引用
@article{arxiv.2509.06941,
title = {Outcome-based Exploration for LLM Reasoning},
author = {Yuda Song and Julia Kempe and Remi Munos},
journal= {arXiv preprint arXiv:2509.06941},
year = {2025}
}
备注
26 pages, 11 figures