一种基于扩散的多轮组合图像生成方法
计算机视觉与模式识别
2023-11-15 v2 人工智能
机器学习
摘要
多轮组合图像生成(M-CIG)是一项具有挑战性的任务,旨在根据修改文本迭代地操控参考图像。尽管大多数现有 M-CIG 方法基于生成对抗网络(GANs),近期图像生成的进展已证明扩散模型优于 GANs。本文中,我们提出一种用于 M-CIG 的基于扩散的方法,名为带图像组合匹配的条件去噪扩散(CDD-ICM)。我们利用 CLIP 作为图像与文本编码器的主干,并引入最初为问答提出的门控融合机制,以在 M-CIG 每一轮组合融合参考图像与修改文本。我们引入一种条件方案以基于融合结果生成目标图像。为优先保证生成目标图像的语义质量,我们在多任务学习框架中学习辅助图像组合匹配(ICM)目标与条件去噪扩散(CDD)目标。此外,我们还执行 ICM 引导与无分类器引导以提升性能。实验结果表明,CDD-ICM 在两个 M-CIG 基准数据集(即 CoDraw 与 i-CLEVR)上取得了最先进的(state-of-the-art)结果。
引用
@article{arxiv.2304.02192,
title = {A Diffusion-based Method for Multi-turn Compositional Image Generation},
author = {Chao Wang},
journal= {arXiv preprint arXiv:2304.02192},
year = {2023}
}
备注
WACV 2024 3rd Workshop on Image/Video/Audio Quality in Computer Vision and Generative AI