更自由的掌控!基于语义扩散引导的图像合成
计算机视觉与模式识别
2022-12-06 v4 图形学
摘要
可控图像合成模型能够根据文本指令或参考图像的引导来生成多样化的图像。最近,去噪扩散概率模型已被证明能比先前方法生成更逼真的图像,并在无条件和类别条件设定下得到了成功验证。我们研究了该类模型的细粒度连续控制,并提出了一种用于语义扩散引导的新颖统一框架,该框架允许语言引导、图像引导或两者兼用。引导通过图像-文本或图像匹配分数的梯度注入到预训练的无条件扩散模型中,无需重新训练扩散模型。我们在一个统一框架中探索了基于 CLIP 的语言引导以及基于内容和风格的图片引导。我们的文本引导合成方法可应用于没有关联文本标注的数据集。我们在 FFHQ 和 LSUN 数据集上进行了实验,并展示了细粒度文本引导图像合成、与风格或内容参考图像相关的图像合成,以及同时具有文本和图像引导的示例结果。
引用
@article{arxiv.2112.05744,
title = {More Control for Free! Image Synthesis with Semantic Diffusion Guidance},
author = {Xihui Liu and Dong Huk Park and Samaneh Azadi and Gong Zhang and Arman Chopikyan and Yuxiao Hu and Humphrey Shi and Anna Rohrbach and Trevor Darrell},
journal= {arXiv preprint arXiv:2112.05744},
year = {2022}
}
备注
WACV 2023. Project page https://xh-liu.github.io/sdg/