用于微调扩散模型的高效伴随匹配
机器学习
2026-05-19 v2
摘要
奖励微调已成为在文本到图像生成中将预训练扩散模型和流模型与人类偏好对齐的常用方法。在基于奖励梯度的方法中,伴随匹配(AM)通过将奖励微调视为一个随机最优控制(SOC)问题,提供了一种原理性的公式化。然而,AM 不可避免地需要大量的计算成本:它需要(i)在无记忆动力学下对完整生成轨迹进行随机模拟,导致大量的函数评估,以及(ii)沿每条采样轨迹对伴随状态进行反向 ODE 模拟。在这项工作中,我们观察到这两个瓶颈都与从预训练模型继承的\textit{非平凡基漂移}密切相关。受此观察启发,我们提出了\textbf{高效伴随匹配(EAM)},它通过使用\textit{线性基漂移}和相应修改的\textit{终端成本}重新形式化 SOC 问题,从而显著提高了训练效率。这种重新形式化消除了两个低效源头;它使得训练时采样能够使用几步确定性 ODE 求解器,并产生一个闭合形式的伴随解,从而消除了反向伴随模拟。在标准的文本到图像奖励微调基准测试上,EAM 的收敛速度比 AM 快达 4 倍,并在包括 PickScore、ImageReward、HPSv2.1、CLIPScore 和 Aesthetics 在内的各种指标上达到或超越了 AM。
引用
@article{arxiv.2605.11480,
title = {Efficient Adjoint Matching for Fine-tuning Diffusion Models},
author = {Jeongwoo Shin and Dongsoo Shin and Yuchen Zhu and Wei Guo and Yongxin Chen and Joonseok Lee and Jaewoong Choi and Jaemoo Choi},
journal= {arXiv preprint arXiv:2605.11480},
year = {2026}
}