中文

Feat2GS:基于高斯融合探测视觉基础模型

计算机视觉与模式识别 2026-02-03 v2

摘要

鉴于视觉基础模型(VFMs)在大规模数据集上进行训练,但常仅限于 2D 图像,因此一个自然的问题是:它们在多大程度上理解 3D 世界?由于架构和训练协议(即目标、代理任务)的差异,对其 3D 感知能力进行公正且全面的探测迫在眼睫。现有关于 3D 探测的工作表明,单视图 2.5D 估计(如深度和法线)或双视图稀疏 2D 对应(如匹配和跟踪)。不幸的是,这些任务忽略了纹理感知,并需要 3D 数据作为真实值,这限制了其评估集合的规模和多样性。为解决这些问题,我们引入 Feat2GS,从未标注图像上提取的 VFM 特征中读取 3D 高斯属性。这使我们能够通过新视角合成来探测几何和纹理的 3D 感知能力,而无需 3D 数据。此外,3DGS 参数(几何 x\boldsymbol{x}α\alphaΣ\Sigma 和纹理 c\boldsymbol{c})的解耦,使我们能够单独分析纹理和几何感知能力。在 Feat2GS 下,我们进行了大量实验来探测几种 VFMs 的 3D 感知能力,并研究导致 3D 感知 VFM 的关键因素。基于这些发现,我们开发了几个变体,在多样化的数据集上实现最先进的性能。这使得 Feat2GS 对于探测 VFMs 以及作为简单而有效的新视角合成基线具有重要价值。代码和数据已提供。

关键词

引用

@article{arxiv.2412.09606,
  title  = {Feat2GS: Probing Visual Foundation Models with Gaussian Splatting},
  author = {Yue Chen and Xingyu Chen and Anpei Chen and Gerard Pons-Moll and Yuliang Xiu},
  journal= {arXiv preprint arXiv:2412.09606},
  year   = {2026}
}

备注

Project Page: https://fanegg.github.io/Feat2GS/