中文

面向 3D 视觉基础模型:我们离之多近?

计算机视觉与模式识别 2024-12-10 v2

摘要

构建 3D 视觉的基础模型是一个复杂而未解决的挑战。为此目标,重要的是理解当前模型的 3D 推理能力,以及这些模型与人类之间的差距。因此,我们构建了一个新的 3D 视觉理解基准测试,命名为 UniQA-3D。UniQA-3D 涵盖了视觉问答(VQA)格式下的基本 3D 视觉任务。我们对最新视觉语言模型(VLMs)、专业模型和人类受试者进行评估。我们的结果显示,VLMs 总体表现较差,而专业模型虽然准确但不够稳健,在几何扰动下会失败。相比之下,人类视觉系统仍是最可靠的 3D 视觉系统。我们进一步展示了神经网络与人类 3D 视觉机制的对齐程度高于经典计算机视觉方法,而基于 Transformer 的网络(如 ViT)则与人类 3D 视觉机制的对齐程度高于 CNN。我们希望本研究将促进面向 3D 视觉基础模型的未来发展。代码已公开于 https://github.com/princeton-vl/UniQA-3D。

关键词

引用

@article{arxiv.2410.10799,
  title  = {Towards Foundation Models for 3D Vision: How Close Are We?},
  author = {Yiming Zuo and Karhan Kayan and Maggie Wang and Kevin Jeon and Jia Deng and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2410.10799},
  year   = {2024}
}

备注

Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code