中文

探查大型视觉模型三维物理理解能力的一般协议

计算机视觉与模式识别 2024-06-11 v3

摘要

本文的目标是探查大型视觉模型,以确定它们在多大程度上“理解”图像所描绘三维场景的不同物理属性。为此,我们做出如下贡献:(i) 我们引入一种通用且轻量的协议,通过在这些属性特征上训练判别分类器,来评估现成大型视觉模型的特征是否编码了三维场景的若干物理“属性”。该探针应用于带有属性标注的真实图像数据集。(ii) 我们将此协议应用于涵盖场景几何、场景材质、支撑关系、光照和视相关度量的属性,以及包括 CLIP、DINOv1、DINOv2、VQGAN、Stable Diffusion 在内的大型视觉模型。(iii) 我们发现 Stable Diffusion 与 DINOv2 的特征利于多种属性(包括场景几何、支撑关系、阴影与深度)的判别学习,但在遮挡与材质上表现较弱,同时在所有属性上优于 DINOv1、CLIP 和 VQGAN。(iv) 观察到 Stable Diffusion 特征的不同时间步,以及 DINO/CLIP/VQGAN 的不同 transformer 层,分别擅长不同属性,这开启了三维物理理解的潜在应用。

关键词

引用

@article{arxiv.2310.06836,
  title  = {A General Protocol to Probe Large Vision Models for 3D Physical Understanding},
  author = {Guanqi Zhan and Chuanxia Zheng and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2310.06836},
  year   = {2024}
}