当前自监督学习算法需要多少类人视觉经验才能达到人类水平的物体识别?
计算机视觉与模式识别
2022-05-25 v3 机器学习
神经与进化计算
摘要
本文解决一个基本问题:我们当前的自监督视觉表示学习算法相对于人类而言有多好?更具体地说,这些算法需要多少“类人”的自然视觉经验,才能在诸如 ImageNet 这样的复杂、真实视觉物体识别任务中达到人类水平表现?使用缩放实验,我们在此估计答案为比人类寿命长几个数量级:通常约为一百万到十亿年的自然视觉经验(取决于所用算法)。对于在 ImageNet 衍生的鲁棒性基准中达到人类水平表现,我们获得了更大的估计值。这些估计的确切值对一些基本假设敏感,然而即使在最乐观的情景下,它们仍比人类寿命大几个数量级。我们讨论了围绕我们估计的主要注意事项以及这些令人惊讶结果的含义。
引用
@article{arxiv.2109.11523,
title = {How much human-like visual experience do current self-supervised learning algorithms need in order to achieve human-level object recognition?},
author = {A. Emin Orhan},
journal= {arXiv preprint arXiv:2109.11523},
year = {2022}
}
备注
v3 adds DINO + robustness scaling experiments