中文

Points-to-3D:弥合稀疏点与形状可控文本到 3D 生成之间的鸿沟

计算机视觉与模式识别 2023-07-27 v1

摘要

文本到 3D 生成近期备受关注,其驱动力来自基于数十亿图文对训练的 2D 扩散模型。现有方法主要依赖分数蒸馏来利用 2D 扩散先验监督 3D 模型(如 NeRF)的生成。然而,分数蒸馏易受视角不一致问题影响,且隐式 NeRF 建模亦会导致任意形状,从而造成逼真度低且不可控的 3D 生成。本工作中,我们提出一种灵活的 Points-to-3D 框架,通过蒸馏来自 2D 与 3D 扩散模型的知识,弥合稀疏且易获取的 3D 点与逼真形状可控 3D 生成之间的鸿沟。Points-to-3D 的核心思想是引入可控稀疏 3D 点以引导文本到 3D 生成。具体而言,我们使用由 3D 扩散模型 Point-E 基于单张参考图像生成的稀疏点云作为几何先验。为更好利用稀疏 3D 点,我们提出高效的点云引导损失,自适应驱动 NeRF 的几何与稀疏 3D 点形状对齐。除控制几何外,我们提出优化 NeRF 以获得更具视角一致性的外观。具体地,我们对公开可用的 2D 图像扩散模型 ControlNet 执行分数蒸馏,条件为文本及所学紧凑几何的深度图。定性与定量比较表明,Points-to-3D 改善了视角一致性,并实现了良好的文本到 3D 生成形状可控性。Points-to-3D 为用户提供了一种改进并控制文本到 3D 生成的新途径。

关键词

引用

@article{arxiv.2307.13908,
  title  = {Points-to-3D: Bridging the Gap between Sparse Points and Shape-Controllable Text-to-3D Generation},
  author = {Chaohui Yu and Qiang Zhou and Jingliang Li and Zhe Zhang and Zhibin Wang and Fan Wang},
  journal= {arXiv preprint arXiv:2307.13908},
  year   = {2023}
}

备注

Accepted by ACMMM 2023