中文

RefMask3D:用于 3D 指代分割的语言引导变换器

计算机视觉与模式识别 2024-07-26 v1

摘要

3D 指代分割是一个新兴且具有挑战性的视觉语言任务,旨在分割点云场景中由自然语言表达式描述的对象的分割。该任务的关键挑战在于视觉语言特征的融合与对齐。本文提出了 RefMask3D 来探索全面的多模态特征交互和理解。首先,我们提出了几何增强的 Group-Word Attention 通过跨模态 group-word attention 将语言与几何连贯的子云集成,有效地解决了点云稀疏和不规则性质带来的挑战。然后,我们引入了 Linguistic Primitives Construction 通过产生代表不同语义属性的语义原语,大大增强了解码阶段的视觉语言理解。此外,我们引入了对象聚类模块,用于分析语言原语之间的相互关系,以整合它们的见解并定位共同特征,帮助捕获整体信息并提高目标识别的精度。所提出的 RefMask3D 在 3D 指代分割、3D 视觉定位以及 2D 指代图像分割方面实现了新的领先性能。特别是,RefMask3D 在具有挑战性的 ScanRefer 数据集上比以前的领先方法提高了大约 3.16% 的 mIoU。代码可在 https://github.com/heshuting555/RefMask3D 获取。

引用

@article{arxiv.2407.18244,
  title  = {RefMask3D: Language-Guided Transformer for 3D Referring Segmentation},
  author = {Shuting He and Henghui Ding},
  journal= {arXiv preprint arXiv:2407.18244},
  year   = {2024}
}

备注

ACM MM 2024, Code: https://github.com/heshuting555/RefMask3D