中文

3D实例感知指代语分割的层次化协作融合

计算机视觉与模式识别 2026-03-09 v1

摘要

通用3D指代语分割(3D-GRES)基于自然语言在3D场景中定位目标对象,即使描述匹配多个或没有目标对象亦可。现有方法仅依赖稀疏点云,缺乏丰富的视觉语义以支持精细化描述。我们提出HCF-RES,一个多模态框架,包含两个关键创新点。首先,层次化视觉语义分解利用SAM实例掩码在像素级与实例级双粒度上指导CLIP编码,保留对象边界的2D到3D投影。其次,渐进式多层次融合通过类内模态协作、2D语义与3D几何特征之间的跨模态自适应加权,以及语言引导的细化来整合表示。HCF-RES在ScanRefer和Multi3DRefer数据集上实现了最先进的成绩。

关键词

引用

@article{arxiv.2603.06250,
  title  = {Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation},
  author = {Keshen Zhou and Runnan Chen and Mingming Gong and Tongliang Liu},
  journal= {arXiv preprint arXiv:2603.06250},
  year   = {2026}
}