3D-STMN:用于端到端三维指代表达分割的依存驱动超点–文本匹配网络
计算机视觉与模式识别
2023-09-01 v1
摘要
在三维指代表达分割(3D-RES)中,早期方法采用两阶段范式,先提取分割候选再与指代表达进行匹配。然而,这一传统范式面临显著挑战,最突出的是初始候选生成质量平平以及推理速度明显放缓。认识到这些局限,我们提出了一种创新的端到端超点–文本匹配网络(3D-STMN),并融入依存驱动洞察。我们模型的关键基石之一是超点–文本匹配(STM)机制。与传统方法遍历实例候选不同,STM 直接将语言指示与其对应的超点(语义相关点的簇)相关联。这一架构选择使模型能高效利用跨模态语义关系,主要依托密集标注的超点–文本对,而非更稀疏的实例–文本对。为强化文本在引导分割过程中的作用,我们进一步引入依存驱动交互(DDI)模块,以深化网络对指代表达的语义理解。该模块以依存树为指引,辨识表达式中主要词项与其修饰语之间的复杂关系,从而提升模型的定位与分割能力。在 ScanRefer 基准上的综合实验表明,我们的模型不仅确立了新性能标准,mIoU 提升 11.7 个点,还实现了推理速度的惊人提升,超越传统方法 95.7 倍。代码与模型见 https://github.com/sosppxo/3D-STMN。
引用
@article{arxiv.2308.16632,
title = {3D-STMN: Dependency-Driven Superpoint-Text Matching Network for End-to-End 3D Referring Expression Segmentation},
author = {Changli Wu and Yiwei Ma and Qi Chen and Haowei Wang and Gen Luo and Jiayi Ji and Xiaoshuai Sun},
journal= {arXiv preprint arXiv:2308.16632},
year = {2023}
}