中文

在可微奖励上直接微调扩散模型

计算机视觉与模式识别 2024-06-24 v2 机器学习

摘要

我们提出直接奖励微调(DRaFT),一种简单而有效的微调扩散模型以最大化可微奖励函数(如人类偏好模型的分数)的方法。我们首先表明,可以沿完整采样过程反向传播奖励函数梯度,且这样做能在多种奖励上取得强劲表现,优于基于强化学习的方法。随后我们提出更高效的 DRaFT 变体:DRaFT-K,将反向传播截断至仅采样的最后 K 步;以及 DRaFT-LV,针对 K=1 的情形获得更低方差的梯度估计。我们展示了我们的方法对多种奖励函数均有效,并可用于显著提升 Stable Diffusion 1.4 生成图像的美学质量。最后,我们将该方法与已有工作相联系,为基于梯度的微调算法的设计空间提供了统一视角。

关键词

引用

@article{arxiv.2309.17400,
  title  = {Directly Fine-Tuning Diffusion Models on Differentiable Rewards},
  author = {Kevin Clark and Paul Vicol and Kevin Swersky and David J Fleet},
  journal= {arXiv preprint arXiv:2309.17400},
  year   = {2024}
}

备注

Published at ICLR 2024