SegDINO3D:由图像级与对象级二维特征赋能的3D实例分割
计算机视觉与模式识别
2025-12-01 v2
摘要
在本文中,我们提出了SegDINO3D,一个用于3D实例分割的新型Transformer编码器-解码器框架。由于3D训练数据通常不如2D训练图像充足,SegDINO3D旨在充分利用来自预训练2D检测模型的2D表示,包括图像级和对象级特征,以改进3D表示。SegDINO3D将点云及其关联的2D图像作为输入。在编码器阶段,它首先通过从对应的图像视图中检索2D图像特征来丰富每个3D点,然后利用3D编码器进行3D上下文融合。在解码器阶段,它将3D对象查询公式化为3D锚框,并执行从3D查询到使用2D检测模型从2D图像获得的2D对象查询的交叉注意力。这些2D对象查询作为2D图像的紧凑对象级表示,有效地避免了在内存中保留数千个图像特征图的挑战,同时忠实地保留了预训练2D模型的知识。引入3D框查询还使模型能够利用预测的框来调制交叉注意力,以实现更精确的查询。SegDINO3D在ScanNetV2和ScanNet200 3D实例分割基准上取得了最先进的性能。值得注意的是,在具有挑战性的ScanNet200数据集上,SegDINO3D在验证集和隐藏测试集上分别以+8.6和+6.8 mAP显著优于先前的方法,证明了其优越性。
引用
@article{arxiv.2509.16098,
title = {SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features},
author = {Jinyuan Qu and Hongyang Li and Xingyu Chen and Shilong Liu and Yukai Shi and Tianhe Ren and Ruitao Jing and Lei Zhang},
journal= {arXiv preprint arXiv:2509.16098},
year = {2025}
}