如何增强你的 ViT?一致性损失与 StyleAug:一种随机风格迁移增强
计算机视觉与模式识别
2021-12-20 v1
摘要
Vision Transformer (ViT) 架构近来在各种计算机视觉任务上取得了有竞争力的性能。ViT 背后的动机之一是相较于卷积神经网络(CNNs)具有更弱的归纳偏置。然而这也使得 ViT 更难训练。它们需要非常大的训练数据集、重度正则化和强数据增强。用于训练 ViT 的数据增强策略很大程度上继承自 CNN 训练,尽管两种架构之间存在显著差异。在这项工作中,我们实证评估了不同的数据增强策略在 CNN(例如 ResNet)与 ViT 架构上用于图像分类时的表现。我们引入了一种称为 StyleAug 的风格迁移数据增强,它在训练 ViT 时效果最好,而 RandAugment 和 Augmix 通常在训练 CNN 时效果最好。我们还发现,除了分类损失外,对同一图像多种增强之间使用一致性损失在训练 ViT 时尤其有帮助。
引用
@article{arxiv.2112.09260,
title = {How to augment your ViTs? Consistency loss and StyleAug, a random style transfer augmentation},
author = {Akash Umakantha and Joao D. Semedo and S. Alireza Golestaneh and Wan-Yi S. Lin},
journal= {arXiv preprint arXiv:2112.09260},
year = {2021}
}