基于规则引导的空间感知网络用于端到端 3D 指代体素分割
计算机视觉与模式识别
2024-12-24 v2
摘要
3D 指代体素分割(3D-RES)旨在通过关联指代表达与点云来对 3D 对象进行分割。然而,传统方法常因对实例空间信息的强调不足,导致过度分割或误分割。本文引入一种基于规则引导的空间感知网络(RG-SAN),仅利用目标实例的空间信息进行监督。该方法使网络能够准确描绘描述文本中所有实体的空间关系,从而增强推理能力。RG-SAN 包含文本驱动局部模块(TLM)和规则引导弱监督策略(RWS)。TLM 初始定位所有提及的实例并迭代细化其位置信息。RWS 策略认识到只有目标对象具有受监督的位置信息,利用依赖树规则精确引导核心实例定位。广泛测试表明,RG-SAN 不仅在 ScanRefer 数据集上建立了新的性能基准,mIoU 提升 5.1 分,而且在处理带有空间歧义描述时表现出显著的鲁棒性。所有代码均已公开于 https://github.com/sosppxo/RG-SAN。
引用
@article{arxiv.2412.02402,
title = {RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation},
author = {Changli Wu and Qi Chen and Jiayi Ji and Haowei Wang and Yiwei Ma and You Huang and Gen Luo and Hao Fei and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2412.02402},
year = {2024}
}
备注
Accepted by NeurIPS 2024 (Oral), Code: https://github.com/sosppxo/RG-SAN