中文

强化学习后训练中的 Reinforce Adjoint Matching:扩散与流匹配模型的规模化

机器学习 2026-05-19 v2 计算机视觉与模式识别

摘要

扩散模型和流匹配模型之所以能够规模化,是因为预训练是监督回归:干净样本被分析性地加噪,模型对闭式目标进行回归。RL 后训练使模型与奖励对齐。在图像生成中,这使得样本能够正确组合物体、清晰呈现文本并匹配人类偏好。现有方法依赖高昂的 SDE 滚动、奖励梯度或代理损失,牺牲了预训练的回归结构。我们表明,这一结构也适用于 RL 后训练。在 KL 正则化奖励最大化下,最优生成过程倾斜干净端点分布以获得更高奖励的样本,而保持 noising 法则不变。将这一结合与 adjoint-matching 最优性条件和 REINFORCE 恒等式相结合,我们推导出一种称为 Reinforce Adjoint Matching (RAM) 的方法:一种纠正预训练目标以匹配奖励的一致性损失。在每一步,我们从当前模型中抽取干净端点,评估其奖励,将其加噪如同预训练,然后进行回归。无需 SDE 滚动、反向 adjoint 扫描或奖励梯度。RAM 与预训练目标一样简单且可规模化。在 350 万图像的 Stable Diffusion 上,RAM 在构图、文本渲染和人类偏好方面实现了最高奖励,在最少训练步数(最高多 50 倍)内达到 Flow-GRPO 的峰值奖励。

关键词

引用

@article{arxiv.2605.10759,
  title  = {Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models},
  author = {Andreas Bergmeister and Stefanie Jegelka and Nikolas Nüsken and Carles Domingo-Enrich and Jakiw Pidstrigach},
  journal= {arXiv preprint arXiv:2605.10759},
  year   = {2026}
}