利用扩散模型生成带 3D 标注的图像
计算机视觉与模式识别
2024-04-05 v4
摘要
扩散模型已成为一种强大的生成方法,能够从自然语言描述中生成令人惊叹的照片级真实图像。然而,这些模型缺乏对生成图像中 3D 结构的显式控制。因此,这阻碍了我们对生成图像获取详细 3D 标注或定制具有特定姿态和距离的实例的能力。在本文中,我们提出 3D 扩散风格迁移(3D-DST),将 3D 几何控制引入扩散模型。我们的方法利用 ControlNet,其通过除文本提示外还使用视觉提示来扩展扩散模型。我们生成取自 3D 形状库(例如 ShapeNet 和 Objaverse)的 3D 物体图像,从多种姿态和视角方向渲染它们,计算渲染图像的边缘图,并将这些边缘图用作视觉提示来生成真实图像。通过显式 3D 几何控制,我们可以轻松更改生成图像中物体的 3D 结构并自动获得真值 3D 标注。这使得我们能够改进广泛的视觉任务,例如分类和 3D 姿态估计,无论是在分布内(ID)还是分布外(OOD)设定下。我们通过在 ImageNet-100/200、ImageNet-R、PASCAL3D+、ObjectNet3D 和 OOD-CV 上的大量实验证明了我们方法的有效性。结果表明,我们的方法显著优于现有方法,例如使用 DeiT-B 在 ImageNet-100 上高出 3.8 个百分点。
引用
@article{arxiv.2306.08103,
title = {Generating Images with 3D Annotations Using Diffusion Models},
author = {Wufei Ma and Qihao Liu and Jiahao Wang and Angtian Wang and Xiaoding Yuan and Yi Zhang and Zihao Xiao and Guofeng Zhang and Beijia Lu and Ruxiao Duan and Yongrui Qi and Adam Kortylewski and Yaoyao Liu and Alan Yuille},
journal= {arXiv preprint arXiv:2306.08103},
year = {2024}
}
备注
ICLR 2024 Spotlight. Code: https://ccvl.jhu.edu/3D-DST/