中文

配置数据增强以减少视觉转换器位置嵌入中的方差偏移

计算机视觉与模式识别 2024-05-24 v1 人工智能 机器学习

摘要

视觉转换器 (ViT) 在各种视觉任务中展现出卓越的性能。尽管具有前景的能力,但训练 ViT 需要大量多样化的数据。最近的研究发现,使用丰富的数据增强(如 Mixup、Cutmix 和随机擦除)是成功训练 ViT 的关键。目前,已将使用丰富数据增强的做法确立为标准做法。然而,我们报告了这种做法的一个漏洞:某些数据增强(如 Mixup)会导致 ViT 位置嵌入的方差偏移,这一问题一直是隐藏因素,导致 ViT 在测试阶段性能下降。我们认为,实现位置嵌入的稳定效果需要满足特定条件,而当前的数据增强方法常常破坏了这一条件。我们对此问题进行详细分析,并提供正确配置这些数据增强的方法,以消除方差偏移的副作用。实验表明,遵循我们的指导方针可提高 ViT 的性能,而不仅仅是使用当前数据增强的配置。

关键词

引用

@article{arxiv.2405.14115,
  title  = {Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision Transformers},
  author = {Bum Jun Kim and Sang Woo Kim},
  journal= {arXiv preprint arXiv:2405.14115},
  year   = {2024}
}

备注

16 pages, 4 figures