中文

自回归模型中作为策略改进的奖励加权无分类器导引

机器学习 2026-04-20 v1 人工智能

摘要

考虑一个自回归模型,它产生输出 x(例如问题的答案、分子),每个输出都可以用属性向量 y(例如有用性 vs. 无害性,或生物利用度 vs. 亲脂性)来概括。任意奖励函数 r(y) 编码了这些属性之间的权衡。通常,在训练时通过强化学习来倾斜模型的采样分布以增加此奖励。然而,如果奖励函数发生变化,重新对齐需要重新训练。在本文中,我们展示了奖励加权无分类器导引(RCFG)可以在该设定中作为策略改进算子,通过 Q 函数逼近对采样分布的倾斜。我们将 RCFG 应用于分子生成,证明它可以在测试时优化新的奖励函数。最后,我们展示了使用 RCFG 作为教师并蒸馏到基础策略中以作为热启动,可显著加快标准 RL 的收敛速度。

关键词

引用

@article{arxiv.2604.15577,
  title  = {Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models},
  author = {Alexander Peysakhovich and William Berman},
  journal= {arXiv preprint arXiv:2604.15577},
  year   = {2026}
}