中文

HyperSDFusion:桥接语言与几何中的层次结构以增强 3D Text2Shape 生成

计算机视觉与模式识别 2024-05-01 v3

摘要

从文本生成 3D 形状是 3D 表示学习中的一项基本任务。文本 - 形状对表现出层次结构,其中像“椅子”这样的一般性文本涵盖了椅子的所有 3D 形状,而更详细的提示则指代更具体的形状。此外,文本和 3D 形状本质上都是层次结构。然而,现有的 Text2Shape 方法(如 SDFusion)并未利用这一点。在本工作中,我们提出了 HyperSDFusion,这是一种双分支扩散模型,可根据给定文本生成 3D 形状。由于双曲空间适合处理层次数据,我们提出在双曲空间中学习文本和 3D 形状的层次表示。首先,我们引入了一种双曲文本 - 图像编码器,以在双曲空间中学习文本的序列和多模态层次特征。此外,我们设计了一个双曲文本 - 图卷积模块,以在双曲空间中学习文本的层次特征。为了充分利用这些文本特征,我们引入了一种双分支结构,将文本特征嵌入到 3D 特征空间中。最后,为了赋予生成的 3D 形状层次结构,我们设计了一种双曲层次损失。我们的方法是首个探索用于文本到形状生成的双曲层次表示的方法。在现有文本到形状配对数据集 Text2Shape 上的实验结果达到了最先进的水平。我们在 HyperSDFusion.github.io 发布了我们的实现代码。

关键词

引用

@article{arxiv.2403.00372,
  title  = {HyperSDFusion: Bridging Hierarchical Structures in Language and Geometry for Enhanced 3D Text2Shape Generation},
  author = {Zhiying Leng and Tolga Birdal and Xiaohui Liang and Federico Tombari},
  journal= {arXiv preprint arXiv:2403.00372},
  year   = {2024}
}