中文

基于文本-图像条件化扩散的一致性文本到3D生成

计算机视觉与模式识别 2023-12-20 v1

摘要

通过将预训练的2D扩散模型提升至神经辐射场,文本到3D生成方法取得了巨大进展。许多最先进的方法通常应用分数蒸馏采样来优化NeRF表示,该方法利用预训练的文本条件化2D扩散模型(如 Imagen)来监督NeRF优化。然而,此类预训练扩散模型提供的监督信号仅依赖于文本提示,并未约束多视角一致性。为了将跨视角一致性注入扩散先验,一些近期工作利用多视角数据微调2D扩散模型,但仍缺乏细粒度的视角连贯性。为应对这一挑战,我们将多视角图像条件引入NeRF优化的监督信号中,从而显式地强制实现细粒度的视角一致性。借助这种更强的监督,我们提出的文本到3D方法有效缓解了浮点伪影(由于密度过高)和完全空白空间(由于密度不足)的生成。我们在 T3^3Bench 数据集上的定量评估表明,我们的方法优于现有的文本到3D方法,达到了最先进的性能。我们将公开代码。

关键词

引用

@article{arxiv.2312.11774,
  title  = {Text-Image Conditioned Diffusion for Consistent Text-to-3D Generation},
  author = {Yuze He and Yushi Bai and Matthieu Lin and Jenny Sheng and Yubin Hu and Qi Wang and Yu-Hui Wen and Yong-Jin Liu},
  journal= {arXiv preprint arXiv:2312.11774},
  year   = {2023}
}