OVSeg3R: 从2D通过3D重建学习开放词汇实例分割
计算机视觉与模式识别
2026-01-06 v2
摘要
在本文中,我们提出了一种名为 OVSeg3R 的训练方案,用于借助3D重建从成熟的2D感知模型学习开放词汇3D实例分割。OVSeg3R 直接采用来自2D视频的重建场景作为输入,避免了昂贵的手动调整,同时使输入与现实应用对齐。通过利用3D重建模型提供的2D到3D对应关系,OVSeg3R 将每个视图的2D实例掩码预测(来自开放词汇2D模型)投影到3D,为该视图对应的子场景生成标注。为了避免因2D到3D的部分标注而错误引入假正例作为监督信号,我们提出了一种视图感知实例划分算法,该算法将预测划分到各自视图进行监督,从而稳定训练过程。此外,由于3D重建模型倾向于过度平滑几何细节,仅基于几何将重建点聚类为代表超点(如主流3D分割方法所常见)可能会忽略几何上不显著的对象。因此,我们引入了2D实例边界感知超点,利用2D掩码约束超点聚类,防止超点违反实例边界。通过这些设计,OVSeg3R 不仅将最先进的封闭词汇3D实例分割模型扩展到开放词汇,还大幅缩小了尾部类别与头部类别之间的性能差距,最终在 ScanNet200 基准上实现了 +2.3 mAP 的整体提升。此外,在标准开放词汇设置下,OVSeg3R 在新类别上以约 +7.1 mAP 超越了先前方法,进一步验证了其有效性。
引用
@article{arxiv.2509.23541,
title = {OVSeg3R: Learn Open-vocabulary Instance Segmentation from 2D via 3D Reconstruction},
author = {Hongyang Li and Jinyuan Qu and Lei Zhang},
journal= {arXiv preprint arXiv:2509.23541},
year = {2026}
}