3D-GRES:通用 3D 指代语义分割
计算机视觉与模式识别
2024-08-01 v2
摘要
3D 指代语义分割(3D-RES)旨在基于自然语言描述对 3D 空间中的特定实例进行分割。然而,当前方法仅限于分割单个目标,限制了该任务的灵活性。为克服这一限制,我们提出了通用 3D 指代语义分割(3D-GRES),其扩展了基于自然语言指令对任意数量实例进行分割的能力。在解决这一更广泛的任务时,我们提出了多查询解耦互动网络(MDIN),旨在将多目标分割任务分解为更简单的单目标分割。MDIN 包含两个基本组件:文本驱动稀疏查询(TSQ)和多目标解耦优化(MDO)。TSQ 生成分布在关键目标上的稀疏点云特征,作为查询的初始化。而 MDO 则负责在多目标场景中将每个目标分配给不同的查询,同时保持其语义一致性。为适应这一新任务,我们构建了一个新数据集,称为 Multi3DRes。我们的全面评估表明,在该数据集上,现有模型获得了显著的提升,从而为复杂的多目标 3D 场景理解指明了新方向。该基准和代码均已公开于 https://github.com/sosppxo/MDIN。
引用
@article{arxiv.2407.20664,
title = {3D-GRES: Generalized 3D Referring Expression Segmentation},
author = {Changli Wu and Yihang Liu and Jiayi Ji and Yiwei Ma and Haowei Wang and Gen Luo and Henghui Ding and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2407.20664},
year = {2024}
}
备注
Accepted by ACM MM 2024 (Oral), Code: https://github.com/sosppxo/MDIN