自回归模型中作为策略改进的奖励加权无分类器导引
机器学习
2026-04-20 v1 人工智能
摘要
考虑一个自回归模型,它产生输出 x(例如问题的答案、分子),每个输出都可以用属性向量 y(例如有用性 vs. 无害性,或生物利用度 vs. 亲脂性)来概括。任意奖励函数 r(y) 编码了这些属性之间的权衡。通常,在训练时通过强化学习来倾斜模型的采样分布以增加此奖励。然而,如果奖励函数发生变化,重新对齐需要重新训练。在本文中,我们展示了奖励加权无分类器导引(RCFG)可以在该设定中作为策略改进算子,通过 Q 函数逼近对采样分布的倾斜。我们将 RCFG 应用于分子生成,证明它可以在测试时优化新的奖励函数。最后,我们展示了使用 RCFG 作为教师并蒸馏到基础策略中以作为热启动,可显著加快标准 RL 的收敛速度。
引用
@article{arxiv.2604.15577,
title = {Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models},
author = {Alexander Peysakhovich and William Berman},
journal= {arXiv preprint arXiv:2604.15577},
year = {2026}
}