TokenMixup:面向 Transformer 的高效注意力引导词元级数据增强
计算机视觉与模式识别
2022-10-17 v1
摘要
Mixup 是一种常用的图像分类数据增强技术。近期 mixup 方法的进展主要聚焦于基于显著性的混合。然而,许多显著性检测器计算密集,对参数庞大的 transformer 模型尤为繁重。为此,我们提出 TokenMixup,一种高效的注意力引导词元级数据增强方法,旨在最大化混合词元集的显著性。与基于梯度的方法相比,TokenMixup 提供快 15 倍的显著性感知数据增强。此外,我们引入 TokenMixup 的一种变体,其在单一实例内混合词元,从而实现多尺度特征增强。实验表明,我们的方法在 CIFAR 与 ImageNet-1K 上显著提升基线模型性能,同时比先前方法更高效。我们还在从零训练的 transformer 模型中于 CIFAR-100 上达到最先进性能。代码见 https://github.com/mlvlab/TokenMixup。
引用
@article{arxiv.2210.07562,
title = {TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers},
author = {Hyeong Kyu Choi and Joonmyung Choi and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2210.07562},
year = {2022}
}
备注
Accepted paper at NeurIPS 2022