中文

一种基于扩散的多轮组合图像生成方法

计算机视觉与模式识别 2023-11-15 v2 人工智能 机器学习

摘要

多轮组合图像生成(M-CIG)是一项具有挑战性的任务,旨在根据修改文本迭代地操控参考图像。尽管大多数现有 M-CIG 方法基于生成对抗网络(GANs),近期图像生成的进展已证明扩散模型优于 GANs。本文中,我们提出一种用于 M-CIG 的基于扩散的方法,名为带图像组合匹配的条件去噪扩散(CDD-ICM)。我们利用 CLIP 作为图像与文本编码器的主干,并引入最初为问答提出的门控融合机制,以在 M-CIG 每一轮组合融合参考图像与修改文本。我们引入一种条件方案以基于融合结果生成目标图像。为优先保证生成目标图像的语义质量,我们在多任务学习框架中学习辅助图像组合匹配(ICM)目标与条件去噪扩散(CDD)目标。此外,我们还执行 ICM 引导与无分类器引导以提升性能。实验结果表明,CDD-ICM 在两个 M-CIG 基准数据集(即 CoDraw 与 i-CLEVR)上取得了最先进的(state-of-the-art)结果。

关键词

引用

@article{arxiv.2304.02192,
  title  = {A Diffusion-based Method for Multi-turn Compositional Image Generation},
  author = {Chao Wang},
  journal= {arXiv preprint arXiv:2304.02192},
  year   = {2023}
}

备注

WACV 2024 3rd Workshop on Image/Video/Audio Quality in Computer Vision and Generative AI