SceneGenie:用于图像合成的场景图引导扩散模型
计算机视觉与模式识别
2023-05-01 v1 人工智能
摘要
近年来,文本条件图像生成在生成对抗网络以及更近的扩散模型中取得了显著进展。尽管基于文本提示条件的扩散模型已生成令人印象深刻的高质量图像,但准确表示复杂文本提示(如特定对象的实例数量)仍然具有挑战性。为解决此局限,我们提出一种用于扩散模型采样过程的新颖引导方法,该方法在推理时利用边界框与分割图信息而无需额外训练数据。通过采样过程中的新颖损失,我们的方法以来自 CLIP 嵌入的语义特征引导模型并强制几何约束,从而生成准确表示场景的高分辨率图像。为获取边界框与分割图信息,我们将文本提示构建为场景图并以 CLIP 嵌入丰富节点。我们提出的模型在从场景图生成图像的两个公开基准上取得了最先进性能,在各项指标上超越场景图到图像与基于文本的扩散模型。我们的结果证明了在扩散模型采样过程中引入边界框与分割图引导对于更准确文本到图像生成的有效性。
引用
@article{arxiv.2304.14573,
title = {SceneGenie: Scene Graph Guided Diffusion Models for Image Synthesis},
author = {Azade Farshad and Yousef Yeganeh and Yu Chi and Chengzhi Shen and Björn Ommer and Nassir Navab},
journal= {arXiv preprint arXiv:2304.14573},
year = {2023}
}