缩小人类与机器视觉差距的部分进展
摘要
几年前,第一个 CNN 在 ImageNet 上超越了人类表现。然而,很快便清楚机器在更具挑战性的测试用例上缺乏鲁棒性,这是在“真实世界”中部署机器以及获得更好的人类视觉感知计算模型的主要障碍。在此我们追问:我们在缩小人类与机器视觉差距方面是否取得了进展?为回答该问题,我们在广泛的分布外(OOD)数据集上测试了人类观察者,在 90 名参与者中记录了 85,120 个心理物理学试验。随后我们研究了一系列有前景的机器学习进展,这些进展沿三个轴关键地偏离了标准监督式 CNN:目标函数(自监督、对抗训练、CLIP 语言-图像训练)、架构(如视觉 transformer)和数据集规模(从 1M 到 1B 不等)。我们的发现有三方面。(1.) 人类与 CNN 之间长期存在的畸变鲁棒性差距正在缩小,最佳模型如今在大多数所研究的 OOD 数据集上超越了人类的前馈表现。(2.) 仍存在显著的图片级一致性差距,即人类与模型所犯错误不同。相比之下,大多数模型在其分类错误上系统性地一致,即使是差异很大的模型如对比自监督模型与标准监督模型也是如此。(3.) 在许多情况下,当训练数据集规模增加一个到三个数量级时,人类到模型的一致性得到提升。我们的结果给出了谨慎乐观的理由:尽管仍有很大改进空间,人类与机器视觉之间的行为差异正在收窄。为衡量未来进展,我们提供了一个工具箱和基准,包含 17 个带有图片级人类行为数据的 OOD 数据集及评估代码:https://github.com/bethgelab/model-vs-human/
引用
@article{arxiv.2106.07411,
title = {Partial success in closing the gap between human and machine vision},
author = {Robert Geirhos and Kantharaju Narayanappa and Benjamin Mitzkus and Tizian Thieringer and Matthias Bethge and Felix A. Wichmann and Wieland Brendel},
journal= {arXiv preprint arXiv:2106.07411},
year = {2021}
}
备注
NeurIPS 2021 Oral, camera ready version. A preliminary version of this work was presented as Oral at the 2020 NeurIPS workshop on "Shared Visual Representations in Human & Machine Intelligence" (arXiv:2010.08377)