中文

InstaFlow:一步即足以实现高质量的基于扩散模型的文本到图像生成

机器学习 2024-03-26 v2 计算机视觉与模式识别

摘要

扩散模型以其卓越的质量和创造力革新了文本到图像生成。然而,其多步采样过程众所周知地缓慢,常常需要数十次推理步骤才能获得令人满意的结果。先前通过蒸馏来提升采样速度并降低计算成本的尝试,均未能成功实现可用的一步模型。在本文中,我们探索了一种近期被称为 Rectified Flow 的方法,该方法迄今为止仅应用于小规模数据集。Rectified Flow 的核心在于其 reflow 过程,该过程拉直概率流的轨迹,精炼噪声与图像之间的耦合,并促进以学生模型进行的蒸馏过程。我们提出了一种新颖的文本条件流水线,将 Stable Diffusion (SD) 转化为超快的一步模型,其中我们发现 reflow 在改善噪声与图像之间的对应关系中起着关键作用。利用我们的新流水线,我们创建了——据我们所知——首个具有 SD 级图像质量的基于扩散模型的一步文本到图像生成器,在 MS COCO 2017-5k 上取得了 23.323.3 的 FID (Frechet Inception Distance),显著超越了先前的 state-of-the-art 技术渐进式蒸馏(37.237.2 \rightarrow 23.323.3 的 FID)。通过使用具有 1.7B 参数的扩展网络,我们进一步将 FID 提升至 22.422.4。我们将我们的一步模型称为 InstaFlow。在 MS COCO 2014-30k 上,InstaFlow 仅在 0.090.09 秒内取得 13.113.1 的 FID,在 0.1\leq 0.1 秒区间内最佳,优于近期的 StyleGAN-T(0.10.1 秒内 13.913.9)。值得注意的是,InstaFlow 的训练仅耗费 199 A100 GPU 天。代码与预训练模型可在 \url{github.com/gnobitab/InstaFlow} 获取。

关键词

引用

@article{arxiv.2309.06380,
  title  = {InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image Generation},
  author = {Xingchao Liu and Xiwen Zhang and Jianzhu Ma and Jian Peng and Qiang Liu},
  journal= {arXiv preprint arXiv:2309.06380},
  year   = {2024}
}

备注

ICLR 2024