中文

利用流匹配增强潜在扩散模型

计算机视觉与模式识别 2024-12-05 v3

摘要

视觉合成近期在性能上取得了显著飞跃,这在很大程度上归功于生成式模型的突破。扩散模型一直是关键的推动者,因为它们在图像多样性方面表现出色。然而,这是以缓慢的训练和合成为代价的,潜在扩散仅部分缓解了这一问题。为此,流匹配因其具有更快的训练和推理但合成多样性较低的互补特性而成为一种极具吸引力的方法。我们证明,在冻结的扩散模型和卷积解码器之间引入流匹配,能够以更低的计算成本和模型尺寸实现高分辨率图像合成。随后,一个小型扩散模型可有效提供必要的视觉多样性,而流匹配通过将小型模型映射到高维潜在空间,高效地增强分辨率和细节。这些潜在表示随后通过潜在扩散方法的后续卷积解码器投影为高分辨率图像。结合扩散模型的多样性、流匹配的效率以及卷积解码器的有效性,以最小的计算成本实现了 SOTA 的高分辨率图像合成,分辨率达 102421024^2 像素。进一步扩展我们的方法,分辨率可达 204822048^2 像素。重要的是,我们的方法与底层模型近似的加速策略正交,使其易于集成到各种扩散模型框架中。

关键词

引用

@article{arxiv.2312.07360,
  title  = {Boosting Latent Diffusion with Flow Matching},
  author = {Johannes Schusterbauer and Ming Gui and Pingchuan Ma and Nick Stracke and Stefan A. Baumann and Vincent Tao Hu and Björn Ommer},
  journal= {arXiv preprint arXiv:2312.07360},
  year   = {2024}
}

备注

ECCV 2024 (Oral), Project Page: https://compvis.github.io/fm-boosting/