TokenMix:重新思考视觉Transformer中用于数据增强的图像混合方法
计算机视觉与模式识别
2023-04-20 v3
摘要
CutMix是一种流行的增强技术,常用于训练现代卷积和Transformer视觉网络。它最初旨在鼓励卷积神经网络(CNN)更多地关注图像的全局上下文而非局部信息,这极大提升了CNN的性能。然而,我们发现它对天然具有全局感受野的基于Transformer的架构益处有限。本文提出一种新颖的数据增强技术TokenMix,以提升视觉Transformer的性能。TokenMix在token级别混合两幅图像,将混合区域划分为多个分离的部分。此外,我们指出CutMix中的混合学习目标(一对真实标签的线性组合)可能不准确且有时反直觉。为获得更合适的目标,我们提出根据来自预训练教师模型的两幅图像基于内容的神经激活图来分配目标分数,该教师模型无需具备高性能。通过在多种视觉Transformer架构上的大量实验,我们表明所提TokenMix有助于视觉Transformer聚焦于前景区域以推断类别,并增强其对遮挡的鲁棒性,且取得一致的性能提升。值得注意的是,我们将DeiT-T/S/B在ImageNet top-1准确率上提升了+1%。此外,TokenMix支持更长训练,使用训练400轮的DeiT-S在ImageNet上达到了81.2%的top-1准确率。代码见 https://github.com/Sense-X/TokenMix。
引用
@article{arxiv.2207.08409,
title = {TokenMix: Rethinking Image Mixing for Data Augmentation in Vision Transformers},
author = {Jihao Liu and Boxiao Liu and Hang Zhou and Hongsheng Li and Yu Liu},
journal= {arXiv preprint arXiv:2207.08409},
year = {2023}
}
备注
ECCV 2022; Code: https://github.com/Sense-X/TokenMix