中文

Frido:面向复杂场景图像生成的特征金字塔扩散模型

计算机视觉与模式识别 2022-12-02 v2 人工智能 机器学习

摘要

扩散模型(DMs)在高质量图像合成方面已展现出巨大潜力。然而,在生成具有复杂场景的图像时,如何恰当地描述图像全局结构与物体细节仍是一项挑战。本文提出 Frido,一种执行多尺度由粗到细去噪过程以进行图像合成的特征金字塔扩散(Feature Pyramid Diffusion)模型。我们的模型将输入图像分解为尺度相关的矢量量化特征,随后通过由粗到细的门控生成图像输出。在上述多尺度表示学习阶段,可进一步利用文本、场景图或图像布局等额外输入条件。因此,Frido 也可应用于条件式或跨模态图像合成。我们在多种无条件与条件图像生成任务上进行了大量实验,涵盖文本到图像合成、布局到图像、场景图到图像以及标签到图像。具体而言,我们在五个基准上取得了最先进的 FID 分数,即 COCO 和 OpenImages 上的布局到图像、COCO 和 Visual Genome 上的场景图到图像,以及 COCO 上的标签到图像。代码见 https://github.com/davidhalladay/Frido。

关键词

引用

@article{arxiv.2208.13753,
  title  = {Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis},
  author = {Wan-Cyuan Fan and Yen-Chun Chen and Dongdong Chen and Yu Cheng and Lu Yuan and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2208.13753},
  year   = {2022}
}

备注

AAAI 2023