基于可组合扩散模型的组合式视觉生成
计算机视觉与模式识别
2023-01-18 v6 人工智能
机器学习
摘要
大型文本引导的扩散模型,如DALLE-2,能够根据自然语言描述生成令人惊叹的照片级真实图像。尽管此类模型高度灵活,它们难以理解某些概念的组合,例如混淆不同对象的属性或对象间的关系。在本文中,我们提出一种使用扩散模型进行组合式生成的替代结构化方法。图像通过组合一组扩散模型来生成,其中每个模型建模图像的某一组件。为此,我们将扩散模型解释为基于能量的模型,其中由能量函数定义的数据分布可被显式组合。所提方法能够在测试时生成比训练中所见复杂得多的场景,组合句子描述、对象关系、人脸属性,甚至泛化到现实世界中极少见的新的组合。我们进一步说明我们的方法如何用于组合预训练的文本引导扩散模型,并生成包含输入描述中所有细节的照片级真实图像,包括已被证明对DALLE-2而言困难的对象属性绑定。这些结果指向所提方法在促进视觉生成结构化泛化方面的有效性。项目页面:https://energy-based-model.github.io/Compositional-Visual-Generation-with-Composable-Diffusion-Models/
引用
@article{arxiv.2206.01714,
title = {Compositional Visual Generation with Composable Diffusion Models},
author = {Nan Liu and Shuang Li and Yilun Du and Antonio Torralba and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2206.01714},
year = {2023}
}
备注
ECCV 2022. First three authors contributed equally. Project website: https://energy-based-model.github.io/Compositional-Visual-Generation-with-Composable-Diffusion-Models/