中文

DiffI2I:一种高效的图像到图像翻译扩散模型

计算机视觉与模式识别 2023-08-29 v1

摘要

扩散模型(DM)已成为图像合成的最先进(SOTA)方法。然而,现有 DM 在某些图像到图像翻译(I2I)任务上表现不佳。与图像合成不同,一些 I2I 任务(如超分辨率)要求生成与 GT 图像相符的结果。传统的图像合成 DM 需要大量迭代和大型去噪模型来估计完整图像,这赋予了它们强大的生成能力,但也导致 I2I 中的伪影和低效。为应对这一挑战,我们提出了一种简单、高效且强大的 I2I 扩散模型框架,称为 DiffI2I。具体而言,DiffI2I 包含三个关键组件:紧凑 I2I 先验提取网络(CPEN)、动态 I2I 变换器(DI2Iformer)和去噪网络。我们分两个阶段训练 DiffI2I:预训练与 DM 训练。对于预训练,GT 与输入图像被送入 CPENS1_{S1} 以捕获引导 DI2Iformer 的紧凑 I2I 先验表示(IPR)。在第二阶段,DM 被训练为仅使用输入图像来估计与 CPENS1_{S1} 相同的 IRP。相比传统 DM,紧凑的 IPR 使 DiffI2I 能获得更准确的结果,并采用更轻量的去噪网络和更少的迭代。通过在多种 I2I 任务上的大量实验,我们证明 DiffI2I 在显著减少计算负担的同时达到了 SOTA 性能。

关键词

引用

@article{arxiv.2308.13767,
  title  = {DiffI2I: Efficient Diffusion Model for Image-to-Image Translation},
  author = {Bin Xia and Yulun Zhang and Shiyin Wang and Yitong Wang and Xinglong Wu and Yapeng Tian and Wenming Yang and Radu Timotfe and Luc Van Gool},
  journal= {arXiv preprint arXiv:2308.13767},
  year   = {2023}
}