中文

3D-PC:人类与机器视觉视角采择的基准

计算机视觉与模式识别 2025-03-03 v2 人机交互

摘要

视觉视角采择(VPT)是感知和推理他人视角的能力。它是人类智能的基本特征,在生命的前十年发展,需要处理视觉场景3D结构的能力。越来越多的报告表明,深度神经网络(DNN)在大型图像数据集上训练后能够分析3D场景。我们通过3D感知挑战(3D-PC)研究了DNN中这种新兴的3D分析能力是否足以用于VPT:这是一个针对人类和DNN的3D感知新基准。3D-PC包含自然场景图像中的三个3D分析任务:1. 对象深度顺序的简单测试,2. 基本VPT任务(VPT-basic),以及3. 另一种VPT版本(VPT-Strategy),旨在限制“捷径”视觉策略的有效性。我们测试了人类参与者(N=33)并通过线性探测或文本提示测试了超过300个DNN,发现几乎所有DNN在分析对象深度顺序方面接近或超过人类准确率。令人惊讶的是,DNN在此任务上的准确率与其对象识别性能相关。相比之下,在VPT-basic上,DNN与人类之间存在巨大差距。人类几乎完美,而大多数DNN接近随机水平。在VPT-basic上微调DNN使其接近人类表现,但不同于人类,当在VPT-Strategy上测试时,它们又回落到随机水平。我们的挑战表明,当今DNN的训练流程和架构非常适合学习场景和对象的基本3D属性,但不适合像人类那样推理这些属性。我们发布了3D-PC数据集和代码,以帮助弥合人类与机器在3D感知方面的这一差距。

关键词

引用

@article{arxiv.2406.04138,
  title  = {The 3D-PC: a benchmark for visual perspective taking in humans and machines},
  author = {Drew Linsley and Peisen Zhou and Alekh Karkada Ashok and Akash Nagaraj and Gaurav Gaonkar and Francis E Lewis and Zygmunt Pizlo and Thomas Serre},
  journal= {arXiv preprint arXiv:2406.04138},
  year   = {2025}
}

备注

Published in ICLR 2025