3DDesigner:基于文本引导扩散模型实现逼真三维物体生成与编辑
计算机视觉与模式识别
2023-10-13 v3
摘要
文本引导扩散模型在图像/视频生成与编辑中展现出优越性能,而在三维场景中的探索甚少。本文讨论该主题下三个基础且有趣的问题。首先,我们赋予文本引导扩散模型以实现三维一致生成的能力。具体而言,我们集成类NeRF神经场,为给定相机视角生成低分辨率粗结果,此类结果可作为后续扩散过程的3D先验条件信息。在去噪扩散过程中,我们通过以新颖的双流(对应两个不同视角)异步扩散过程建模跨视角对应,进一步增强三维一致性。其次,我们研究三维局部编辑并提出两步解决方案,可通过从单视角编辑物体生成360度操控结果。步骤1,我们提出通过混合预测噪声执行2D局部编辑。步骤2,我们进行噪声到文本的逆过程,将2D混合噪声映射到视角无关的文本嵌入空间。一旦获得相应文本嵌入,即可生成360度图像。最后但并非最不重要的,我们将模型扩展为通过在单张图像上微调来执行一次性新视角合成,首次展示了利用文本引导进行新视角合成的潜力。大量实验与各类应用展现了我们3DDesigner的能力。项目页面见 https://3ddesigner-diffusion.github.io/。
引用
@article{arxiv.2211.14108,
title = {3DDesigner: Towards Photorealistic 3D Object Generation and Editing with Text-guided Diffusion Models},
author = {Gang Li and Heliang Zheng and Chaoyue Wang and Chang Li and Changwen Zheng and Dacheng Tao},
journal= {arXiv preprint arXiv:2211.14108},
year = {2023}
}
备注
Submitted to IJCV