中文

视觉 Transformer 比新生视觉系统更依赖数据吗?

计算机视觉与模式识别 2023-12-06 v1 人工智能 机器学习 神经与进化计算

摘要

视觉 Transformer(ViT)在许多计算机视觉基准上表现顶尖,并能准确预测人类在物体识别任务中的行为。然而,研究人员质疑将 ViT 用作生物学习模型的价值,因为 ViT 被认为比大脑更依赖数据,需要更多训练数据才能达到相近的性能水平。为检验这一假设,我们通过对 ViT 和新生雏鸡进行并行的受控饲养实验,直接比较了 ViT 与动物的学习能力。我们首先在仅包含单一物体的贫乏视觉环境中饲养雏鸡,然后在视频游戏引擎中构建虚拟动物室来模拟这些环境中可用的训练数据。我们记录了智能体在虚拟室中移动时获取的第一人称图像,并利用这些图像训练自监督 ViT,该模型以时间作为教学信号,类似于生物视觉系统。当 ViT 通过新生雏鸡的视角进行训练时,它们解决了与雏鸡相同的视角不变物体识别任务。因此,ViT 并不比新生视觉系统更依赖数据:两者均在贫乏视觉环境中习得了视角不变的物体表征。ViT 中灵活通用的基于注意力的学习机制,结合新生动物可获得的具身数据流,似乎足以驱动类似动物的物体识别能力的发展。

关键词

引用

@article{arxiv.2312.02843,
  title  = {Are Vision Transformers More Data Hungry Than Newborn Visual Systems?},
  author = {Lalit Pandey and Samantha M. W. Wood and Justin N. Wood},
  journal= {arXiv preprint arXiv:2312.02843},
  year   = {2023}
}

备注

Accepted in Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)