中文

GOQ:基于模拟与真实多面体评估视觉基础模型3D几何推理

计算机视觉与模式识别 2026-02-06 v3

摘要

现代的单目3D重建方法和视觉-语言模型 (VLM) 在标准基准测试上表现出色,但近期研究对其对几何属性的真实理解持怀疑态度。我们引入 GOQ,一个全面的基准,专门用于评估视觉和视觉-语言基础模型的几何推理能力。GOQ 包含合成和真实世界的图像及其对应的3D网格,这些网格涵盖从不规则、阿基米德、约翰逊到星形和复合形状的多种复杂性和对称性的多面体。通过涉及单目3D重建、3D对称检测、心理旋转测试和零样形状分类任务的系统实验,我们揭示了当前模型的显著不足。在大量3D数据集上训练的领先重建算法难以准确重建甚至最基本的几何不规则 solid。尽管基础模型可能通过线性和非线性探针捕获特定的3D对称元素,但在需要详细几何区分的任务中表现力不足,例如心理旋转。此外,像 ChatGPT、Gemini 和 Claud 等高级视觉-语言助手在解释基本形状属性(如面几何、凸凸性和复合结构)方面表现出惊人的低准确率。GOQ 在 toomanymatts.github.io/giq-benchmark/ 上公开提供,为评估几何智能的关键差距并促进稳健、几何感知的表征学习提供了结构化平台。

关键词

引用

@article{arxiv.2506.08194,
  title  = {GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra},
  author = {Mateusz Michalkiewicz and Anekha Sokhal and Tadeusz Michalkiewicz and Piotr Pawlikowski and Mahsa Baktashmotlagh and Varun Jampani and Guha Balakrishnan},
  journal= {arXiv preprint arXiv:2506.08194},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Camera ready version