中文

更简扩散 (SiD2): 在ImageNet512上以像素空间扩散实现1.5 FID

计算机视觉与模式识别 2025-03-25 v2 机器学习 机器学习

摘要

潜在扩散模型已成为扩展扩散模型以实现高分辨率图像合成的主流选择。与端到端训练的像素空间模型相比,潜在模型被认为更高效,且在高分辨率下能产生更高的图像质量。本文挑战了这些观点,并表明像素空间模型在质量和效率上均可与潜在模型竞争,在ImageNet512上实现了1.5 FID,并在ImageNet128、ImageNet256和Kinetics600上取得了新的SOTA结果。我们提出了一种将端到端像素空间扩散模型扩展到高分辨率的简单方案:1. 使用我们指定的超参数采用sigmoid损失加权(Kingma & Gao, 2023);2. 使用我们简化的内存高效架构,减少跳跃连接;3. 扩展模型,使其倾向于用更少的参数处理高分辨率图像,而不是在较低分辨率下使用更多参数。将这些方法与引导区间相结合,我们得到了一系列像素空间扩散模型,称为更简扩散(SiD2)。

关键词

引用

@article{arxiv.2410.19324,
  title  = {Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion},
  author = {Emiel Hoogeboom and Thomas Mensink and Jonathan Heek and Kay Lamerigts and Ruiqi Gao and Tim Salimans},
  journal= {arXiv preprint arXiv:2410.19324},
  year   = {2025}
}

备注

Accepted to CVPR 2025