DITTO-NeRF:基于扩散的迭代式文本到全景三维模型
计算机视觉与模式识别
2023-04-07 v1 人工智能
摘要
对高质量 3D 内容创建日益增长的需求推动了从单张图像和/或文本提示自动生成 3D 物体模型方法的发展。然而,使用最先进的图像到 3D 方法重建的 3D 物体仍表现出与给定图像对应度低以及多视角一致性差。近期最先进的文本到 3D 方法同样受限,每个提示生成的 3D 样本多样性低且合成时间长。为应对这些挑战,我们提出 DITTO-NeRF,一种从文本提示或单张图像生成高质量 3D NeRF 模型的新流程。我们的 DITTO-NeRF 首先利用给定或文本生成的从前视角的 2D 图像,为受限边界(IB)角度构建高质量局部 3D 物体,随后使用修复隐扩散模型迭代重建剩余 3D NeRF。我们在 DITTO-NeRF 中提出基于尺度(低到高分辨率)、角度(先 IB 角度后外边界(OB)角度)与掩码(物体到背景边界)的渐进式 3D 物体重建方案,以使 IB 上的高质量信息可传播至 OB。我们的 DITTO-NeRF 在保真度与多样性上定性与定量均优于最先进方法,且训练时间远快于 DreamFusion、NeuralLift-360 等先前图像/文本到 3D 方法。
引用
@article{arxiv.2304.02827,
title = {DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model},
author = {Hoigi Seo and Hayeon Kim and Gwanghyun Kim and Se Young Chun},
journal= {arXiv preprint arXiv:2304.02827},
year = {2023}
}
备注
Project page: https://janeyeon.github.io/ditto-nerf/