中文

用于扩散对齐的拼接价值模型

计算机视觉与模式识别 2026-05-20 v1 人工智能 机器学习

摘要

在实际应用中,基于扩散或流的生成模型必须与特定任务的奖励(如提示保真度或美学偏好)对齐。这种对齐具有挑战性,因为奖励是针对干净输出图像定义的,而对齐过程需要在含噪中间潜变量处估计价值函数。现有方法采用 Tweedie 式或蒙特卡洛近似,在估计器偏差和计算成本之间进行权衡:Tweedie 估计效率高但有偏,而蒙特卡洛估计更准确但需要昂贵的展开。一个自然的替代方案是学习价值函数,但如何有效地为含噪潜变量训练一个强大且通用的价值模型仍是一个悬而未决的问题。在此,我们提出 StitchVM,一个模型拼接框架,它能高效地将针对干净图像预训练的奖励模型迁移到含噪潜变量域。StitchVM 从一个现有的、截断的像素空间奖励模型出发,并将一个冻结的扩散骨干网络作为其头部附加到该模型上。由此产生的混合模型从像素空间模型保留了经过精心预训练的、鲁棒的奖励能力;从扩散骨干网络继承了其原生处理含噪潜变量的能力。拼接过程异常轻量,例如,拼接并微调 CLIP ViT-L 和 SD 3.5 Medium 仅需 10 个 GPU 小时。通过将强大的像素空间奖励模型提升到潜空间,StitchVM 开辟了一种新的扩散对齐方式:不再对价值函数进行粗糙且昂贵的逐样本近似,而是为实际的含噪潜变量一次性构建正确的函数,然后在许多样本和迭代中分摊其成本。我们证明,这种方法在广泛的下游引导和后训练方法中带来了改进:DPS 速度提升 3.2×3.2\times,同时峰值 GPU 内存减半,DiffusionNFT 速度提升 2.3×2.3\times

关键词

引用

@article{arxiv.2605.19804,
  title  = {Stitched Value Model for Diffusion Alignment},
  author = {Hyojun Go and Hyungjin Chung and Prune Truong and Goutam Bhat and Li Mi and Zhaochong An and Zixiang Zhao and Dominik Narnhofer and Serge Belongie and Federico Tombari and Konrad Schindler},
  journal= {arXiv preprint arXiv:2605.19804},
  year   = {2026}
}

备注

Project page: https://gohyojun15.github.io/StitchVM/