DINO 入室:利用 2D 基础模型进行 3D 分段
计算机视觉与模式识别
2026-01-23 v2
摘要
在大规模图像数据集上训练的视觉基础模型(VFM)提供的高质量特征已显著推动了 2D 视觉识别。然而,其在 3D 场景分段中的潜力仍基本未被利用,尽管 2D 图像与 3D 点云数据集常常可得。尽管已有大量研究致力于 2D-3D 融合,但近期的最先进 3D 方法主要关注 3D 数据,使 VFM 融入 3D 模型的集成仍受到忽视。在本工作中,我们挑战这一趋势,提出 DITR,这是一种通用方法,从 2D 基础模型提取特征,投影到 3D,然后注入 3D 点云分段模型。DITR 在室内和户外 3D 语义分段基准测试中均实现了最先进结果。为在推理时即使没有图像也能使用 VFM,我们额外提出通过蒸馏 2D 基础模型来预训练 3D 模型。通过从 2D VFM 蒸馏的知识初始化 3D backbone,为下游 3D 分段任务创建了强大的基础,最终提升了各种数据集上的性能。
引用
@article{arxiv.2503.18944,
title = {DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation},
author = {Karim Knaebel and Kadir Yilmaz and Daan de Geus and Alexander Hermans and David Adrian and Timm Linder and Bastian Leibe},
journal= {arXiv preprint arXiv:2503.18944},
year = {2026}
}
备注
Accepted to 3DV 2026. Project page at https://vision.rwth-aachen.de/ditr