MixPro:基于 MaskMix 与渐进注意力标注的视觉 Transformer 数据增强方法
计算机视觉与模式识别
2023-08-08 v2
摘要
近期提出的数据增强方法 TransMix 采用注意力标签来帮助视觉 Transformer(ViT)获得更好的鲁棒性与性能。然而,TransMix 在两方面存在不足:1)TransMix 的图像裁剪方法可能不适用于 ViT。2)在训练早期,模型产生不可靠的注意力图。TransMix 使用不可靠的注意力图来计算混合注意力标签,从而影响模型。为解决上述问题,我们分别在图像空间和标签空间提出了 MaskMix 与渐进注意力标注(PAL)。具体而言,从图像空间角度,我们设计了 MaskMix,其基于类图像块的网格掩码混合两幅图像。特别地,每个掩码块的大小可调且为图像块大小的整数倍,这保证了每个图像块仅来自一幅图像并包含更多全局内容。从标签空间角度,我们设计了 PAL,其利用一个渐进因子对混合注意力标签的注意力权重进行动态重加权。最后,我们将 MaskMix 与渐进注意力标注结合作为新的数据增强方法,命名为 MixPro。实验结果表明,我们的方法能够在 ImageNet 分类上提升多种规模的基于 ViT 的模型(基于 DeiT-T 训练 300 轮达到 73.8% 的 top-1 准确率)。在 ImageNet 上使用 MixPro 预训练后,基于 ViT 的模型在语义分割、目标检测与实例分割上也展现出更好的可迁移性。此外,与 TransMix 相比,MixPro 在多个基准上也表现出更强的鲁棒性。代码见 https://github.com/fistyee/MixPro。
引用
@article{arxiv.2304.12043,
title = {MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer},
author = {Qihao Zhao and Yangyu Huang and Wei Hu and Fan Zhang and Jun Liu},
journal= {arXiv preprint arXiv:2304.12043},
year = {2023}
}
备注
ICLR 2023, 16 pages, 6 figures