中文

理解ViT为何在小数据集上训练不佳:一种直观视角

计算机视觉与模式识别 2023-02-09 v1 机器学习

摘要

Vision transformer (ViT) 是一种注意力神经网络架构,已被证明对计算机视觉任务有效。然而,与参数数量相近的 ResNet-18 相比,ViT 在小数据集上训练时评估准确率显著更低。为了促进相关领域的研究,我们提供一种视觉直观理解,以帮助理解为何如此。我们首先比较了两个模型的性能,并确认 ViT 在小数据集上训练时准确率低于 ResNet-18。然后我们通过展示 ViT 的注意力图可视化和 ResNet-18 的特征图可视化来解释结果。通过表征相似性视角进一步分析了差异。我们得出结论,在小数据集上训练的 ViT 的表征与在大数据集上训练的 ViT 的表征差异巨大,这可能是其在小数据集上性能大幅下降的原因。

关键词

引用

@article{arxiv.2302.03751,
  title  = {Understanding Why ViT Trains Badly on Small Datasets: An Intuitive Perspective},
  author = {Haoran Zhu and Boyuan Chen and Carter Yang},
  journal= {arXiv preprint arXiv:2302.03751},
  year   = {2023}
}