中文

通过多视角对应分析评估基础模型的3D理解能力

计算机视觉与模式识别 2026-01-19 v2

摘要

评估基础模型的3D空间理解能力对于机器人和自动驾驶等实际应用至关重要。现有的评估方法通常依赖带有线性头或任务特定解码器的下游微调,这使得难以分离预训练编码器的内在3D推理能力。在本工作中,我们提出了一种新的上下文3D场景理解基准,无需微调即可直接探测密集视觉特征的质量。基于评估上下文2D场景理解的Hummingbird框架,我们将设置扩展到3D多视角ImageNet(MVImgNet)数据集。给定一组描绘特定相机角度物体的图像(键),我们基准测试分割新视角(查询)的性能,并根据键-查询视角对比将得分报告为简单、中等、困难、极端4个类别。我们基准测试了7种最先进的基础模型,结果表明基于DINO的编码器在大视角偏移下仍具有竞争力。我们的代码公开地址:https://github.com/ToyeshC/open-hummingbird-3d-eval。

关键词

引用

@article{arxiv.2512.11574,
  title  = {Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis},
  author = {Valentina Lilova and Toyesh Chakravorty and Julian I. Bibo and Emma Boccaletti and Brandon Li and Lívia Baxová and Cees G. M. Snoek and Mohammadreza Salehi},
  journal= {arXiv preprint arXiv:2512.11574},
  year   = {2026}
}

备注

NeurIPS 2025 UniReps workshop, to be published in PMLR