基于策略梯度的后训练:最优性与基础模型壁垒
机器学习
2026-03-10 v1 人工智能
机器学习
摘要
我们研究具有结果奖励和过程奖励的线性自回归模型后训练。在给定上下文 的情况下,模型必须预测响应 ,这是一长度为 的序列,满足 边际条件,即标准可分性的延伸。我们证明,在基础模型实现非平凡似然 的测试样本上,策略梯度(PG)的变体可以几乎最小损失的奖励查询数 实现似然 。然而,一个障碍出现在超出基础模型支持范围时。我们证明,后训练后使用结果奖励的总体预期误差由一种名为似然分位(Likelihood Quantile, LQ)的基础模型属性支配,并且 PG 的变体虽然是最小损失的,但可能需要相对于 的指数级奖励查询数才能超出此支持,无论预训练算法如何。为克服这一障碍,我们研究使用过程奖励模型的后训练,展示了 PG 在此设置下的变体通过依赖于标记级 LQ 避免 的维度诅咒。顺便我们证明,在边际条件下,带自适应学习率的 SGD 实现统计学习的近最优测试误差,PG 带自适应学习率实现在线学习的近最优错误数,同时在可能的情况下具有计算效率,这两者可能独立地具有兴趣。
引用
@article{arxiv.2603.06957,
title = {Post-Training with Policy Gradients: Optimality and the Base Model Barrier},
author = {Alireza Mousavi-Hosseini and Murat A. Erdogdu},
journal= {arXiv preprint arXiv:2603.06957},
year = {2026}
}
备注
36 pages, 2 figures