中文

基于词汇丰富度提升 3D GS 初始化的通用框架用于文本到 3D 生成

计算机视觉与模式识别 2024-08-05 v1

摘要

文本到 3D 内容创建近期受到广泛关注,尤其是由于 3D 高斯溅写 (3D Gaussian Splatting) 的流行。一般而言,基于 GS 的方法包含两个关键阶段:初始化和渲染优化。为实现初始化,现有工作直接应用随机球体初始化或 3D 扩散模型(如 Point-E)以派生初始形状。然而,这些策略存在两个关键且具有挑战性的问题:1)最终形状即使在训练后仍与初始形状相似;2)只能为简单文本(如"一条狗")生成形状,而无法为词汇丰富的文本(如"一条狗正坐在飞机顶部")生成形状。为解决这些问题,本文提出一种新颖的通用框架,用于提升基于词汇丰富度的 3D GS 初始化以实现文本到 3D 生成。我们的关键思想是将 3D 高斯聚合到空间均匀的体素中以表示复杂形状,同时实现 3D 高斯之间的空间相互作用以及高斯与文本之间的语义相互作用。具体而言,我们首先构建体素化表示,其中每个体素保存一个其位置、尺度和旋转固定的 3D 高斯,仅通过不透明度因素决定位置的占据。我们随后设计一个初始化网络,主要由两个新颖组件构成:1)全局信息感知 (GIP) 块和 2)高斯-文本融合 (GTF) 块。这种设计使每个 3D 高斯能够吸收来自其他区域的空间信息和来自文本的语义信息。大量实验表明,我们的框架在高质量 3D GS 初始化方面优于现有方法(如 Shap-E),可处理词汇简单、中等和困难的文本。此外,我们的框架可无缝集成到最先进的训练框架(如 LucidDreamer)中,以实现语义一致的文本到 3D 生成。

关键词

引用

@article{arxiv.2408.01269,
  title  = {A General Framework to Boost 3D GS Initialization for Text-to-3D Generation by Lexical Richness},
  author = {Lutao Jiang and Hangyu Li and Lin Wang},
  journal= {arXiv preprint arXiv:2408.01269},
  year   = {2024}
}