超越重要抽样:拒绝门控策略优化
机器学习
2026-04-17 v1 人工智能
摘要
我们提出了一种新的政策优化视角:而不是对所有样本按其重要性比率进行重新加权,优化器应选择哪些样本值得信赖足以驱动政策更新。在此观点基础上,我们引入了拒绝门控政策优化(RGPO),将重要抽样比率r_theta = pi_theta / pi_old替换为范围为[0, 1]的光滑、可微的接受门alpha_theta(s, a) = g(r_theta(s, a))。与先前工作在训练前以数据水平启发式方式应用拒绝抽样不同,RGPO将拒绝提升为优化原则:该门直接参与梯度计算,并与政策一起隐式更新。RGPO提供了一个统一的框架:TRPO、PPO和REINFORCE的政策梯度都对应于有效梯度权重w(r) = g'(r) * r的特定选择。我们证明了RGPO即使在重要抽样比率呈重尾分布(其中IS方差发散)时,也保证有限、有界的梯度方差。我们进一步表明,RGPO仅引入受控的有界偏差,并提供类似TRPO的近似单调政策改进保证。RGPO在计算成本上与PPO相当,无需二阶优化,同时可自然扩展到RLHF风格的偏好对齐。在Qwen2.5-1.5B-Instruct上的在线偏好微调中(n=3个随机种子),RGPO采用双比率门,将学习锚定在 previous 政策和参考模型上,实现了Pareto优势结果:在线RL方法中获得最高奖励(相对于PPO-RLHF提升14.8%)和最低KL散度到参考模型(相对于PPO-RLHF降低16.0%,相对于GRPO降低53.1%)。
引用
@article{arxiv.2604.14895,
title = {Beyond Importance Sampling: Rejection-Gated Policy Optimization},
author = {Ziwu Sun and Zhen Gao and Jiyong Zhang and Jiaheng Li},
journal= {arXiv preprint arXiv:2604.14895},
year = {2026}
}
备注
27 pages, includes theoretical analysis and experiments