中文

人类与AI在识别异常姿态物体上的比较

计算机视觉与模式识别 2025-02-04 v3 机器学习

摘要

深度学习在多个物体识别基准测试中正在缩小与人类视觉的差距。本文研究了在物体以异常姿态出现的具有挑战性的图像上的这一差距。我们发现人类在识别此类姿态下的物体方面表现出色。相比之下,最先进的视觉深度网络(EfficientNet、SWAG、ViT、SWIN、BEiT、ConvNext)和最先进的大型视觉-语言模型(Claude 3.5、Gemini 1.5、GPT-4)在异常姿态上系统性地脆弱,但Gemini在该条件下表现出优异的鲁棒性。当我们限制图像曝光时间时,人类的表现下降到深度网络的水平,这表明识别异常姿态下的物体需要额外的心理过程(需要额外的时间)。对人类与网络错误模式的分析表明,即使时间受限的人类也与前馈深度网络不同。总之,我们的比较揭示了人类和深度网络在识别异常姿态物体时依赖不同的机制。理解额外观看时间内发生的心理过程的本质可能是再现人类视觉鲁棒性的关键。

关键词

引用

@article{arxiv.2402.03973,
  title  = {A comparison between humans and AI at recognizing objects in unusual poses},
  author = {Netta Ollikka and Amro Abbas and Andrea Perin and Markku Kilpeläinen and Stéphane Deny},
  journal= {arXiv preprint arXiv:2402.03973},
  year   = {2025}
}

备注

version accepted at TMLR