中文

混合BYOL-ViT:处理小数据集的高效方法

计算机视觉与模式识别 2021-11-16 v2 人工智能

摘要

监督学习可以学习大的表示空间,这对处理困难的学习任务至关重要。然而,由于模型设计,经典的图像分类方法在处理小数据集时难以泛化到新问题和新情况。事实上,监督学习可能会丢失图像特征的位置,导致在非常深的架构中出现监督崩溃。在本文中,我们研究了如何通过强且充分的未标记数据增强的自监督学习,比监督学习更有效地训练神经网络的前几层,而无需数百万的标记数据。主要目标是通过获取通用的任务无关的低级特征,将像素数据与注释解耦。此外,我们研究了Vision Transformers (ViT),并表明从自监督架构中导出的低级特征可以提高这种新兴架构的鲁棒性和整体性能。我们在最小的开源数据集之一STL-10上评估了我们的方法,当将自监督学习架构的低级特征输入ViT而不是原始图像时,性能从41.66%显著提升到83.25%。

关键词

引用

@article{arxiv.2111.04845,
  title  = {Hybrid BYOL-ViT: Efficient approach to deal with small datasets},
  author = {Safwen Naimi and Rien van Leeuwen and Wided Souidene and Slim Ben Saoud},
  journal= {arXiv preprint arXiv:2111.04845},
  year   = {2021}
}