中文

小数据集下视觉Transformer的高效训练

计算机视觉与模式识别 2021-11-16 v2 机器学习

摘要

视觉Transformer(VTs)正作为一种替代卷积网络(CNNs)的架构范式兴起。与CNNs不同,VTs能够捕捉图像元素之间的全局关系,并且具有更大的表示容量潜力。然而,由于缺乏典型的卷积归纳偏置,这些模型比常见的CNNs更需要数据。事实上,嵌入在CNN架构设计中的一些视觉领域的局部特性,在VTs中需要从样本中学习。在本文中,我们实证分析了不同的VTs,比较了它们在小训练集设定下的鲁棒性,并表明尽管在ImageNet上训练时具有可比的准确率,它们在较小数据集上的表现可能大不相同。此外,我们提出了一种自监督任务,能够以可忽略的计算开销从图像中提取额外信息。该任务鼓励VTs学习图像内的空间关系,并在训练数据稀缺时使VT训练更加鲁棒。我们的任务与标准(监督)训练联合使用,且不依赖于特定的架构选择,因此可轻松插入现有的VTs中。通过对不同VTs和数据集的广泛评估,我们表明我们的方法能够提高(有时是显著地)VTs的最终准确率。我们的代码可在 https://github.com/yhlleo/VTs-Drloc 获取。

关键词

引用

@article{arxiv.2106.03746,
  title  = {Efficient Training of Visual Transformers with Small Datasets},
  author = {Yahui Liu and Enver Sangineto and Wei Bi and Nicu Sebe and Bruno Lepri and Marco De Nadai},
  journal= {arXiv preprint arXiv:2106.03746},
  year   = {2021}
}