MVControl:为多视角扩散模型添加条件控制以实现可控的文本到3D生成
计算机视觉与模式识别
2023-11-29 v2
摘要
我们提出了 MVControl,一种新颖的神经网络架构,它通过引入额外的输入条件(例如边缘图)来增强现有的预训练多视角 2D 扩散模型。我们的方法能够生成可控的多视角图像以及视角一致的 3D 内容。为实现可控的多视角图像生成,我们以 MVDream 为基础模型,并训练一个新的神经网络模块作为额外的插件,用于端到端的任务特定条件学习。为精确控制生成图像的形状与视角,我们创新性地提出了一种新的条件机制,该机制预测一个封装了输入空间与视角条件的嵌入,随后将其全局注入网络。一旦 MVControl 训练完成,便可执行基于分数蒸馏(SDS)损失的优化以生成 3D 内容,在此过程中我们提出使用一种混合扩散先验。该混合先验依赖于一个预训练的 Stable-Diffusion 网络以及我们训练好的 MVControl 以提供额外引导。大量实验表明,我们的方法实现了鲁棒的泛化能力,并支持可控地生成高质量 3D 内容。代码见 https://github.com/WU-CVGL/MVControl/。
引用
@article{arxiv.2311.14494,
title = {MVControl: Adding Conditional Control to Multi-view Diffusion for Controllable Text-to-3D Generation},
author = {Zhiqi Li and Yiming Chen and Lingzhe Zhao and Peidong Liu},
journal= {arXiv preprint arXiv:2311.14494},
year = {2023}
}
备注
Project page: https://lizhiqi49.github.io/MVControl/