缩放或许就是达成具备类人视觉经验的人类水平物体识别能力所需的一切
计算机视觉与模式识别
2023-08-11 v2 机器学习
神经与进化计算
神经元与认知
摘要
本文探讨:若充分扩大规模,当前自监督学习方法能否从人类所学习的同类与同等量的视觉经验中,达到人类水平的视觉物体识别能力。先前关于此问题的工作仅考虑数据规模的缩放。此处,我们考虑数据规模、模型规模与图像分辨率的同时缩放。我们使用视觉Transformer(最大达 633M 参数,ViT-H/14)进行缩放实验,训练所用类人视频数据长达 5K 小时(长时、连续、多为自我中心的视频),图像分辨率最高达 476x476 像素。掩码自编码器(MAE)作为一种自监督学习算法,其高效性使得以不起眼的学术预算运行该缩放实验成为可能。我们发现,若这些因素同时扩大规模,则在亚人水平的模型规模、数据规模与图像规模下达到人类水平的物体识别能力是可行的。举个具体例子,我们估计一个 2.5B 参数的 ViT 模型,使用 20K 小时(2.3 年)类人视频数据与 952x952 像素空间分辨率训练,应能在 ImageNet 上达到约人类水平的准确率。因此,借助极其通用的学习算法与架构,无需任何实质性归纳偏置,即可从类人感知经验(量与类型均类人)中获得基础感知能力的人类水平胜任度。
引用
@article{arxiv.2308.03712,
title = {Scaling may be all you need for achieving human-level object recognition capacity with human-like visual experience},
author = {A. Emin Orhan},
journal= {arXiv preprint arXiv:2308.03712},
year = {2023}
}
备注
v2 adds an Appendix containing results with alternative scaling functions; code & models available from https://github.com/eminorhan/humanlike-vits