LUDVIG:学习无关的 2D 视觉特征提升至高斯光束场景
计算机视觉与模式识别
2025-07-29 v5
摘要
我们解决了将视觉基础模型(如 DINO、SAM 和 CLIP)的能力扩展到 3D 任务的问题。具体而言,我们引入了一种新颖的方法,将 2D 图像特征提升到 3D 场景的高斯光束表示中。与传统依赖于最小化重建损失的ethods 不同,我们的方法采用更简单和更高效的特征聚合技术,辅以图扩散机制。图扩散通过利用 DINOv2 所诱导的 3D 几何和成对相似性,来细化 3D 特征(如粗糙分割掩码)。我们的做法在多个下游任务上实现了与当前最先进方法相当的性能,同时显著加快了速度。值得注意的是,我们仅使用通用 DINOv2 特征即可获得竞争的分割结果,尽管 DINOv2 并未像 SAM 那样在数百万标记分割掩码上进行训练。当应用于 CLIP 特征时,我们的方法在开放词汇对象分割任务中显示出强大的性能,凸显了该方法的多样性。
引用
@article{arxiv.2410.14462,
title = {LUDVIG: Learning-Free Uplifting of 2D Visual Features to Gaussian Splatting Scenes},
author = {Juliette Marrie and Romain Menegaux and Michael Arbel and Diane Larlus and Julien Mairal},
journal= {arXiv preprint arXiv:2410.14462},
year = {2025}
}
备注
Published at ICCV 2025. Project page: https://juliettemarrie.github.io/ludvig