中文

BrightDreamer:面向快速文本到三维生成的通用三维高斯生成框架

计算机视觉与模式识别 2024-11-19 v2

摘要

文本到三维合成最近通过将文本到图像先验与三维表示方法(例如三维高斯泼溅(3D GS))相结合,借助评分蒸馏采样(SDS)取得了引人注目的进展。然而,现有方法的一个障碍是效率低下,即针对单个三维对象进行逐提示优化。因此,从逐提示优化向针对任意未见文本提示的前馈生成范式转变势在必行,但这仍然具有挑战性。一个难点在于如何直接生成数百万个三维高斯来表示一个三维对象。本文提出 BrightDreamer,一种端到端的前馈方法,可实现可泛化且快速(77 毫秒)的文本到三维生成。我们的核心思想是将生成过程建模为从具有预定义位置的锚形状估计三维形变。为此,我们首先提出文本引导形状形变(TSD)网络,以预测形变后的形状及其新位置,这些位置用作三维高斯的中心(一个属性)。为估计其余四个属性(即缩放、旋转、不透明度与球谐(SH)),我们随后设计了一种新颖的文本引导三平面生成器(TTG),用于为三维对象生成三平面表示。每个高斯的中心使我们能够将空间特征变换为这四个属性。所生成的三维高斯最终可以以每秒 705 帧的速度进行渲染。大量实验证明了我们方法相对于现有方法的优越性。此外,BrightDreamer 即使面对复杂文本提示也具备强大的语义理解能力。代码可在项目页面获取。

关键词

引用

@article{arxiv.2403.11273,
  title  = {BrightDreamer: Generic 3D Gaussian Generative Framework for Fast Text-to-3D Synthesis},
  author = {Lutao Jiang and Xu Zheng and Yuanhuiyi Lyu and Jiazhou Zhou and Lin Wang},
  journal= {arXiv preprint arXiv:2403.11273},
  year   = {2024}
}