中文

探索视觉基础模型的3D感知能力

计算机视觉与模式识别 2024-04-15 v1

摘要

近期大规模预训练的进展产生了具有强大能力的视觉基础模型。最近的模型不仅能够对其训练任务中的任意图像进行泛化,它们的中间表示对其他视觉任务(如检测和分割)也很有用。鉴于这类模型可以在2D中分类、描绘和定位物体,我们问它们是否也表示了物体的3D结构?在这项工作中,我们分析了视觉基础模型的3D感知能力。我们假设3D感知意味着表示(1)编码了场景的3D结构,并且(2)跨视图一致地表示表面。我们使用任务特定的探针和零样本推理程序对冻结特征进行了一系列实验。我们的实验揭示了当前模型的几个局限性。我们的代码和分析可在https://github.com/mbanani/probe3d找到。

关键词

引用

@article{arxiv.2404.08636,
  title  = {Probing the 3D Awareness of Visual Foundation Models},
  author = {Mohamed El Banani and Amit Raj and Kevis-Kokitsi Maninis and Abhishek Kar and Yuanzhen Li and Michael Rubinstein and Deqing Sun and Leonidas Guibas and Justin Johnson and Varun Jampani},
  journal= {arXiv preprint arXiv:2404.08636},
  year   = {2024}
}

备注

Accepted to CVPR 2024. Project page: https://github.com/mbanani/probe3d