中文

卷积神经网络与 Transformer 哪个更像人类视觉?

计算机视觉与模式识别 2021-07-02 v2

摘要

现代计算机视觉机器学习模型在特定视觉识别任务(尤其在 ImageNet 等数据集上)的准确率超越人类。然而,高精度可通过多种途径实现。机器学习系统所发现的特定决策函数不仅由系统所接触的数据决定,也由模型的归纳偏置决定,而归纳偏置通常更难刻画。本工作中,我们遵循近期对神经网络模型超越准确率作为评估指标、深入考察错误模式的行为分析趋势。我们的重点是比较一组标准卷积神经网络(CNN)与一种近期提出的基于注意力的网络——Vision Transformer(ViT),后者放宽了 CNN 的平移不变性约束,因此代表一组归纳偏置更弱的模型。基于注意力的网络此前已被证明在视觉任务上达到比 CNN 更高的准确率,而我们利用考察错误一致性更细粒度的新度量证明,它们的错误也与人类错误更为一致。这些结果对构建更像人类的视觉模型以及理解人类视觉对象识别均有启示。

关键词

引用

@article{arxiv.2105.07197,
  title  = {Are Convolutional Neural Networks or Transformers more like human vision?},
  author = {Shikhar Tuli and Ishita Dasgupta and Erin Grant and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2105.07197},
  year   = {2021}
}

备注

Accepted at CogSci 2021. Source code and fine-tuned models are available at https://github.com/shikhartuli/cnn_txf_bias