中文

基于策略梯度的后训练:最优性与基础模型壁垒

机器学习 2026-03-10 v1 人工智能 机器学习

摘要

我们研究具有结果奖励和过程奖励的线性自回归模型后训练。在给定上下文 x\boldsymbol{x} 的情况下,模型必须预测响应 yYN\boldsymbol{y} \in Y^N,这是一长度为 NN 的序列,满足 γ\gamma 边际条件,即标准可分性的延伸。我们证明,在基础模型实现非平凡似然 α\alpha 的测试样本上,策略梯度(PG)的变体可以几乎最小损失的奖励查询数 O~((α1+ε1)/γ2)\tilde{O}((\alpha^{-1} + \varepsilon^{-1})/\gamma^2) 实现似然 1ε1 - \varepsilon。然而,一个障碍出现在超出基础模型支持范围时。我们证明,后训练后使用结果奖励的总体预期误差由一种名为似然分位(Likelihood Quantile, LQ)的基础模型属性支配,并且 PG 的变体虽然是最小损失的,但可能需要相对于 NN 的指数级奖励查询数才能超出此支持,无论预训练算法如何。为克服这一障碍,我们研究使用过程奖励模型的后训练,展示了 PG 在此设置下的变体通过依赖于标记级 LQ 避免 NN 的维度诅咒。顺便我们证明,在边际条件下,带自适应学习率的 SGD 实现统计学习的近最优测试误差,PG 带自适应学习率实现在线学习的近最优错误数,同时在可能的情况下具有计算效率,这两者可能独立地具有兴趣。

关键词

引用

@article{arxiv.2603.06957,
  title  = {Post-Training with Policy Gradients: Optimality and the Base Model Barrier},
  author = {Alireza Mousavi-Hosseini and Murat A. Erdogdu},
  journal= {arXiv preprint arXiv:2603.06957},
  year   = {2026}
}

备注

36 pages, 2 figures