Sketch2NeRF:多视角草图引导的文本到三维生成
计算机视觉与模式识别
2024-01-30 v2 人工智能
摘要
近年来,文本到三维方法已能利用文本描述实现高保真三维内容生成。然而,生成的对象具有随机性,缺乏细粒度控制。草图提供了一种引入此类细粒度控制的低成本途径。但由于草图的抽象性和模糊性,实现灵活控制颇具挑战。本文提出一种多视角草图引导的文本到三维生成框架(即 Sketch2NeRF),为三维生成添加草图控制。具体而言,我们的方法利用预训练的二维扩散模型(如 Stable Diffusion 和 ControlNet)来监督由神经辐射场(NeRF)表示的三维场景的优化。我们提出了一种新颖的同步生成与重建方法,以有效优化 NeRF。在实验中,我们收集了两类多视角草图数据集来评估所提方法。我们证明,我们的方法能够合成具有三维一致性、细粒度草图控制且对文本提示保持高保真度的内容。大量结果表明,我们的方法在草图相似度和文本对齐方面均达到了最先进的性能。
引用
@article{arxiv.2401.14257,
title = {Sketch2NeRF: Multi-view Sketch-guided Text-to-3D Generation},
author = {Minglin Chen and Weihao Yuan and Yukun Wang and Zhe Sheng and Yisheng He and Zilong Dong and Liefeng Bo and Yulan Guo},
journal= {arXiv preprint arXiv:2401.14257},
year = {2024}
}
备注
11 pages, 9 figures