信任批次:基于批次自适应的 RL 后训练策略优化
机器学习
2026-05-13 v1 人工智能
摘要
强化学习在结构上比监督学习更困难,因为策略会改变其学习的数据分布。这种脆弱性在大型模型训练中尤为明显,此时训练系统与 rollout 系统在数值精度、抽样及其他实现细节上存在差异。现有方法通过添加超参数来管理这种脆弱性,这使得算法对其配置更敏感,并需要在任务、模型规模或分布不匹配变化时进行重新调参。这种脆弱性可追溯到当前目标函数通过训练开始前设定的超参数将两种关切信息缠合的结果:trust-region 关切——更新不应使策略偏离其当前值太远;off-policy 关切——来自旧或不同行为策略的数据仅在其仍可靠时才应影响更新。Neither concern is a constant to set in advance, and their severity is reflected in the policy-ratio distribution of the current batch. 我们提出了一种简单而有效的批次自适应目标,取代固定裁剪,使用策略比率的归一化有效样本数。相同的统计量限制得分函数权重并设置 off-policy 正则化器的强度,因此当比率几乎均匀时,更新保持接近通常的 on-policy得分函数更新,当 stale 或不匹配数据导致比率集中时自动收紧,同时保留在高比率 token 上保持非零学习信号。实验在广泛的设置中表明,我们的方法匹配或超过了经过调谦的基线,未引入新的目标超参数,也移除了若干现有的超参数。代码可在 https://github.com/FeynRL-project/FeynRL 查看。
引用
@article{arxiv.2605.12380,
title = {Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training},
author = {Rasool Fakoor and Murdock Aubry and Nicholas Stranges and Alexander J. Smola},
journal= {arXiv preprint arXiv:2605.12380},
year = {2026}
}