中文

VP3D:释放 2D 视觉提示用于文本到 3D 生成

计算机视觉与模式识别 2024-03-26 v1 多媒体

摘要

近期关于文本到 3D 生成的创新以 Score Distillation Sampling (SDS) 为代表,该方法通过直接从 2D 扩散模型蒸馏先验知识,实现了隐式 3D 模型(NeRF)的零样本学习。然而,当前基于 SDS 的模型在处理复杂文本提示时仍然存在困难,通常会产生带有不真实纹理或跨视角不一致问题的扭曲 3D 模型。在本工作中,我们引入了一种新颖的视觉提示引导文本到 3D 扩散模型(VP3D),该模型显式地释放 2D 视觉提示中的视觉外观知识以促进文本到 3D 的生成。VP3D 不再仅使用文本提示监督 SDS,而是首先利用 2D 扩散模型从输入文本生成高质量图像,随后将其作为视觉提示以通过显式的视觉外观增强 SDS 优化。同时,我们将 SDS 优化与额外的可微奖励函数相结合,鼓励 3D 模型的渲染图像在视觉上更好地与 2D 视觉提示对齐,并在语义上与文本提示匹配。通过大量实验,我们表明 VP3D 中的 2D 视觉提示显著简化了 3D 模型视觉外观的学习,从而带来更高的视觉保真度和更精细的纹理。另一个吸引人之处在于,当用给定的参考图像替换自动生成的视觉提示时,VP3D 能够触发风格化文本到 3D 生成的新任务。我们的项目页面可在 https://vp3d-cvpr24.github.io 获取。

关键词

引用

@article{arxiv.2403.17001,
  title  = {VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation},
  author = {Yang Chen and Yingwei Pan and Haibo Yang and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2403.17001},
  year   = {2024}
}

备注

CVPR 2024; Project page: https://vp3d-cvpr24.github.io