将推理作为动作抽象:一种可扩展的中期训练强化学习方法
机器学习
2025-10-14 v3 人工智能
计算与语言
机器学习
摘要
大型语言模型在强化学习(RL)方面表现出色,但完全释放这一潜力需要一个中期训练阶段。一个有效的中期训练阶段应能识别出一组紧凑的有用动作,并通过在线RL实现快速选择。我们通过提出首个关于中期训练如何塑造后期训练的理论结果来形式化这一直觉:它刻画了一个动作子空间,该子空间最小化了剪枝带来的价值近似误差以及后续规划期间的RL误差。我们的分析揭示了中期训练有效性的两个关键决定因素:剪枝效率(它塑造了初始RL策略的先验)及其对RL收敛性的影响(它决定了该策略通过在线交互能得到多大程度的改进)。这些结果表明,当决策空间紧凑且有效视野较短时,中期训练最为有效,这凸显了在动作抽象空间而非原始动作空间中进行操作的重要性。基于这些见解,我们提出了推理作为动作抽象(RA3),一种可扩展的中期训练算法。具体而言,我们推导出一个序列变分下界,并通过RL迭代发现时间一致的潜在结构,随后在引导数据上进行微调来优化该下界。在代码生成任务上的实验证明了我们方法的有效性。在多个基础模型上,RA3在HumanEval和MBPP上的平均性能分别比基础模型和下一个词元预测基线提高了8个和4个点。此外,在HumanEval+、MBPP+、LiveCodeBench和Codeforces的RLVR中,RA3实现了更快的收敛速度和更高的渐近性能。
引用
@article{arxiv.2509.25810,
title = {Learning to Reason as Action Abstractions with Scalable Mid-Training RL},
author = {Shenao Zhang and Donghan Yu and Yihao Feng and Bowen Jin and Zhaoran Wang and John Peebles and Zirui Wang},
journal= {arXiv preprint arXiv:2509.25810},
year = {2025}
}