中文

TextField3D:利用噪声文本场增强开放词汇三维生成

计算机视觉与模式识别 2024-03-15 v2

摘要

近期工作在文本-三维引导下显式地学习三维表示。然而,有限的文本-三维数据限制了生成的词汇规模与文本控制能力。生成器容易对某些文本提示陷入刻板概念,从而丧失开放词汇生成能力。为解决此问题,我们提出了一种条件三维生成模型,即 TextField3D。具体而言,我们建议不直接将文本提示作为输入,而是向给定文本提示的潜空间注入动态噪声,即噪声文本场(Noisy Text Fields, NTFs)。如此,有限的三维数据可被映射到由 NTFs 扩展的适当文本潜空间范围内。为此,提出了一个 NTFGen 模块来建模噪声场中的通用文本潜码。同时,提出了一个 NTFBind 模块将视角不变的图像潜码对齐到噪声场,进一步支持图像条件三维生成。为在几何与纹理上引导条件生成,构建了具有文本-三维判别器和文本-2.5D 判别器的多模态判别机制。与先前方法相比,TextField3D 具有三大优点:1) 大词汇量,2) 文本一致性,3) 低延迟。大量实验表明,我们的方法实现了潜在的开放词汇三维生成能力。

关键词

引用

@article{arxiv.2309.17175,
  title  = {TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields},
  author = {Tianyu Huang and Yihan Zeng and Bowen Dong and Hang Xu and Songcen Xu and Rynson W. H. Lau and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2309.17175},
  year   = {2024}
}

备注

Accepted by ICLR 2024