用于细粒度图像分类的数据增强视觉Transformer
计算机视觉与模式识别
2022-11-28 v2
摘要
近来,视觉Transformer(ViT)在图像识别中取得突破。其自注意力机制(MSA)可提取不同像素块具有判别性的标注信息以提升图像分类精度。然而,其深层中的分类标记往往忽略层间局部特征。此外,嵌入层将为固定尺寸像素块。输入网络不可避免地引入额外图像噪声。为此,我们研究了一种基于数据增强的数据增强视觉Transformer(DAVT),并提出一种用于注意力裁剪的数据增强方法,其以注意力权重为引导裁剪图像并提升网络学习关键特征的能力。其次,我们还提出一种分层注意力选择(HAS)方法,通过过滤与融合层间标记提升层间判别性标记的学习能力。实验结果表明,该方法在两个通用数据集CUB-200-2011和Stanford Dogs上的准确率优于现有主流方法,且分别比原始ViT高1.4%和1.6%。
引用
@article{arxiv.2211.12879,
title = {Data Augmentation Vision Transformer for Fine-grained Image Classification},
author = {Chao Hu and Liqiang Zhu and Weibin Qiu and Weijie Wu},
journal= {arXiv preprint arXiv:2211.12879},
year = {2022}
}
备注
IEEE Signal Processing Letters