基于参考抽样的玻尔兹曼投影用于 KL-正则化 RLVR:目标匹配加权 SFT、有限一次性差距与策略镜像梯度
机器学习
2026-05-05 v1 人工智能
摘要
基于可验证奖励的在线强化学习 (RLVR) 将可检查的结果转化为可扩展的训练信号,但保持在优化路径上的 rollout 生成、验证器评分和参考策略评估。静态加权监督微调 (SFT) 于预计算的 rollout 上进行似乎消除了这一瓶颈,但加权似然仅由奖励决定,未指定其抽样器和权重,这会导致所拟合的策略。本文识别出参考抽样加权-SFT 目标,其诱导的策略等同于固定参考 KL-正则化 RLVR 优化器。优化器是标准的玻尔兹曼目标策略,通过对参考策略按验证器奖励指数倾斜获得。在匹配加权-SFT 诱导的策略到此目标的过程中,密度比权重被迫匹配;在参考抽样子类中,这简化唯一(除提示比例外)为提示归一化玻尔兹曼权重 。BOLT 是该投影的经验估计器。有限一次性分析将确切存储支持价格 与分区估计、有效样本量方差、泛化、优化和近似误差分离。这种分解解释了为何额外的 SFT 纪元无法修复缺失的参考策略覆盖范围,并暴露了温度-覆盖范围-方差之间的关系。在需要自适应抽样时,刷新后的玻尔兹曼投影变为 KL 策略镜像梯度;有限内部求解以准确镜像步骤的增量漂移形式出现。单次 Qwen 实验提供了目标匹配权重、一次性饱和、刷新抽样收益以及优化节省的投影证据,限于所述单次运行范围。
引用
@article{arxiv.2605.02469,
title = {Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent},
author = {Yao Shu and Chenxing Wei and Hongbin Lin and Shuang Qiu and Hui Xiong},
journal= {arXiv preprint arXiv:2605.02469},
year = {2026}
}