中文

ClickSeg3D:基于语义嵌入的少点击交互分割

计算机视觉与模式识别 2026-05-19 v2

摘要

交互式分割通过利用用户提供的点击来逐步细化预测,从而实现高效的标签生成,这在完全监督标签成本高昂或需要泛化到不可见类别时至关重要。现有的3D交互方法受限:大多数按顺序操作,每次只预测一个对象且仅生成二值掩码,而另一些最近的方法依赖于2D基础模型和相机对齐来桥接2D-3D鸿沟。为此,我们提出一种新颖的交互式分割框架,直接作用于稀疏、随机下采样的3D点,并在单次前向传播中处理多个对象点击。我们的框架包括基于点的Transformer编码器和层次化掩码解码器,后者集成了以可学习语义嵌入为条件的多级裁剪-合并操作。不同于以往的交互方法需要在每次手动纠正点击后更新模型,本方法同时推理所有点击查询,建模跨实例的关系,并通过空间和语义嵌入细化空间掩码和语义预测。广泛的实验表明,我们的模型在mIoU指标上比强大的基线提高了20%以上,在单次点击每个实例的设置下,实现了8-10%的跨数据集提升,通常只需一个点击即可完成每个对象的分割。我们的方法为交互式3D实例分割提供了一个通用且高效的解决方案,特别适合机器人操控、导航和快速3D语义标注等实时应用。

关键词

引用

@article{arxiv.2605.08925,
  title  = {ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings},
  author = {Xueyang Kang and Zijian Yu and Kourosh Khoshelham and Liangliang Nan},
  journal= {arXiv preprint arXiv:2605.08925},
  year   = {2026}
}

备注

15 pages, 9 figures, 6 tables