中文

Zigzag扩散采样:扩散模型通过自反思实现自我提升

计算机视觉与模式识别 2024-12-18 v2 机器学习

摘要

扩散模型作为目前最流行的生成范式,可以将条件信息注入生成路径以引导潜在空间向所需方向发展。然而,现有的文本到图像扩散模型常常难以维持高质量的图像以及对具有挑战性提示的提示-图像对齐。为缓解此问题并提升现有预训练扩散模型,本文主要做了三方面的贡献。第一,我们提出扩散自反思技术,交替进行去噪和反转,证明通过去噪与反转之间的指引差异,能够捕获与提示相关的语义信息。第二,基于理论分析,我们推导Zigzag扩散采样(Z-Sampling),一种新颖的自反思基于扩散采样方法,利用去噪与反转之间的指引差异,沿采样路径逐步积累语义信息,从而实现改进的采样结果。此外,作为即插即用方法,Z-Sampling可普遍应用于各种扩散模型(如加速模型和基于Transformer的模型),所需编码和计算成本极低。第三,我们的大量实验表明,Z-Sampling可在各种基准数据集、扩散模型以及性能评估指标上普遍显著提升生成质量。例如,DreamShaper采用Z-Sampling可实现对原结果达94%的HPSv2获胜率提升。此外,Z-Sampling还能进一步提升与其他正交方法(如Diffusion-DPO)结合使用的扩散模型。

关键词

引用

@article{arxiv.2412.10891,
  title  = {Zigzag Diffusion Sampling: Diffusion Models Can Self-Improve via Self-Reflection},
  author = {Lichen Bai and Shitong Shao and Zikai Zhou and Zipeng Qi and Zhiqiang Xu and Haoyi Xiong and Zeke Xie},
  journal= {arXiv preprint arXiv:2412.10891},
  year   = {2024}
}