中文

回到起点:前缀重要性比率稳定了政策优化

人工智能 2026-02-02 v1 机器学习

摘要

强化学习(RL)后训练日益显示出在大型语言模型(LLM)中激发推理行为的强大能力。为了训练效率,通常使用旧采样策略以离散方式生成 rollout,然后用于更新当前目标策略。为纠正采样策略与目标策略之间的差异,大多数现有 RL 目标依赖于基于 token 级别的重要性抽样比率,这主要是由于其计算简单性和数值稳定性。然而,我们注意到,当离散程度较大时,基于 token 级别的校正常常导致训练动态不稳定。本文重新审视了在离散条件下的 LLM 政策优化,证明严格的校正项是前缀重要性比率,而将其放宽为基于 token 级别的近似会在 RL 后训练中引发不稳定。为了在大规模离散漂移下稳定 LLM 优化,我们提出一种简单且有效的目标函数 Minimum Prefix Ratio(MinPRO)。MinPRO 将不稳定的累积前缀比率替换为基于 preceding prefix 中观察到的最小 token 级别比率的非累积替代品。针对 dense 和 mixture-of-experts LLM,在多个数学推理基准测试上进行了广泛实验,表明 MinPRO 在离散 regime 中显著改善了训练稳定性和峰值性能。

关键词

引用

@article{arxiv.2601.22718,
  title  = {A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization},
  author = {Shiye Lei and Zhihao Cheng and Dacheng Tao},
  journal= {arXiv preprint arXiv:2601.22718},
  year   = {2026}
}