中文

ToddlerDiffusion:基于级联薛定谔桥的交互式结构化图像生成

计算机视觉与模式识别 2024-10-08 v2

摘要

扩散模型将从高维分布生成数据的艰巨任务分解为一系列较易的去噪步骤。受此范式启发,我们提出一种新方法,将扩散框架扩展至模态空间,将 RGB 图像生成的复杂任务分解为更简、可解释的若干阶段。我们的方法称为 ToddlerDiffusion,其级联模态特定模型,每个负责生成中间表示,如轮廓、调色板和细节纹理,最终生成高质量 RGB 图像。我们未采用朴素的 LDM 拼接条件机制连接各阶段,而是使用薛定谔桥确定不同模态间的最优传输。尽管采用级联流水线引入了更多阶段,可能导致架构更复杂,但每个阶段都为效率与精度精心构建,超越了 Stable-Diffusion(LDM)性能。模态组合不仅提升整体性能,还带来一致编辑、交互能力、高层可解释性以及更快收敛与采样率等涌现特性。在 LSUN-Churches、ImageNet、CelebHQ 和 LAION-Art 等多样数据集上的大量实验证明了我们方法的有效性,持续优于 SOTA 方法。例如,ToddlerDiffusion 实现了显著效率,在 LSUN-Churches 上匹配 LDM 性能的同时,速度快 2×\times 且架构小 3×\times。项目网站位于:https://toddlerdiffusion.github.io/website/

关键词

引用

@article{arxiv.2311.14542,
  title  = {ToddlerDiffusion: Interactive Structured Image Generation with Cascaded Schr\"odinger Bridge},
  author = {Eslam Abdelrahman and Liangbing Zhao and Vincent Tao Hu and Matthieu Cord and Patrick Perez and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2311.14542},
  year   = {2024}
}