中文

Clutt3R-Seg:基于层次语义线索的稀疏视角杂乱场景三维实例分割用于语言驱动抓取

计算机视觉与模式识别 2026-02-13 v1 机器人学

摘要

可靠的三维实例分割是语言驱动机器人操作的基础,其关键应用在于杂乱环境,其中遮挡、有限视角和噪声掩模会降低感知效果。为此,我们提出Clutt3R-Seg,一个用于杂乱场景中语言驱动抓取的稳健三维实例分割零样本管道。我们的核心思想是引入语义线索的层次实例树。不同于先前方法试图细化噪声掩模,我们的方法将其作为有信息的线索:通过跨视图分组和条件替换,该树抑制过分割和欠分割,生成视图一致的掩模和稳健的三维实例。每个实例都增强了开放词汇语义嵌入,实现从自然语言指令中进行准确目标选择。为处理多阶段任务期间的场景变化,我们进一步引入一致性感知更新,仅通过单张事后图像即可保留实例对应关系,实现高效适应无需重新扫描。Clutt3R-Seg 在合成数据和真实世界数据集上进行评估,并在真实机器人上进行验证。在所有设置下,它在杂乱和稀疏视角场景中均优于当前方法。即使在最具挑战性的重度杂乱序列上,Clutt3R-Seg 的 AP@25 达 61.66,超过基线方法 2.2 倍;仅使用四个输入视角,即可超过 MaskClustering 使用八个视角的 2 倍以上。代码已公开:https://github.com/jeonghonoh/clutt3r-seg。

关键词

引用

@article{arxiv.2602.11660,
  title  = {Clutt3R-Seg: Sparse-view 3D Instance Segmentation for Language-grounded Grasping in Cluttered Scenes},
  author = {Jeongho Noh and Tai Hyoung Rhee and Eunho Lee and Jeongyun Kim and Sunwoo Lee and Ayoung Kim},
  journal= {arXiv preprint arXiv:2602.11660},
  year   = {2026}
}

备注

Accepted to ICRA 2026. 9 pages, 8 figures