中文

XMask3D: 跨模态掩码推理用于开放词汇3D语义分割

计算机视觉与模式识别 2024-11-21 v1 人工智能

摘要

现有开放词汇3D语义分割方法主要集中于建立包含3D、2D和文本模态的统一特征空间。然而,全局特征对齐或视觉-语言模型蒸馏等传统技术仅施加近似对应,在描绘细粒度分割边界方面存在困难。为解决这一差距,我们提出了一种通过跨模态掩码推理框架XMask3D在3D特征与2D文本嵌入空间之间进行更精细的掩码级对齐。在我们的方法中,我们基于预训练扩散模型的去噪UNet开发了一个掩码生成器,利用其对密集像素表示进行精确文本控制的能力,并增强生成掩码的开放世界适应性。我们进一步将3D全局特征作为隐式条件集成到预训练的2D去噪UNet中,使得能够生成具有额外3D几何感知的分割掩码。随后,利用生成的2D掩码将掩码级3D表示与视觉-语言特征空间对齐,从而增强3D几何嵌入的开放词汇能力。最后,我们融合互补的2D和3D掩码特征,在多个3D开放词汇语义分割基准上取得了有竞争力的性能。代码可在https://github.com/wangzy22/XMask3D获取。

关键词

引用

@article{arxiv.2411.13243,
  title  = {XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation},
  author = {Ziyi Wang and Yanbo Wang and Xumin Yu and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2411.13243},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024