组合与征服:基于扩散的3D深度感知可组合图像合成
计算机视觉与模式识别
2024-01-18 v1
摘要
为了解决文本作为文本条件扩散模型中精确布局表示来源的局限性,许多工作引入了额外信号来约束生成图像中的某些属性。尽管取得了成功,但先前的工作并未考虑这些属性延伸到三维平面中的具体定位。在此背景下,我们提出了一种条件扩散模型,该模型将三维物体放置的控制与来自多个示例图像的全局风格语义的解耦表示相结合。具体来说,我们首先引入\textit{深度解耦训练},利用物体的相对深度作为估计器,使模型能够通过使用合成图像三元组识别未见物体的绝对位置。我们还引入了\textit{软引导},一种无需任何额外定位线索即可将全局语义施加到目标区域的方法。我们的集成框架\textsc{Compose and Conquer (CnC)}统一了这些技术,以解耦的方式定位多个条件。我们证明,我们的方法能够感知不同深度处的物体,同时提供了一个用于组合具有不同全局语义的局部物体的通用框架。代码:https://github.com/tomtom1103/compose-and-conquer/
引用
@article{arxiv.2401.09048,
title = {Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis},
author = {Jonghyun Lee and Hansam Cho and Youngjoon Yoo and Seoung Bum Kim and Yonghyun Jeong},
journal= {arXiv preprint arXiv:2401.09048},
year = {2024}
}
备注
ICLR 2024