中文

SMMix:面向视觉Transformer的自驱动图像混合方法

计算机视觉与模式识别 2023-03-20 v2

摘要

CutMix 是决定视觉Transformer(ViT)性能与泛化能力的重要增强策略。然而,混合图像与对应标签之间的不一致性损害了其效能。现有的 CutMix 变体通过生成更一致的混合图像或更精确的混合标签来解决该问题,但不可避免地引入了沉重的训练开销或需要额外信息,削弱了易用性。为此,我们提出了一种新颖且高效的自驱动图像混合方法(SMMix),该方法由训练中的模型自身驱动图像与标签的增强。具体而言,我们提出了一种最大-最小注意力区域混合方法,以丰富混合图像中受注意力关注的目标。然后,我们引入了一种细粒度标签分配技术,用细粒度监督对混合图像的输出 token 进行协同训练。此外,我们设计了一种新颖的特征一致性约束,以对齐混合与未混合图像的特征。得益于自驱动范式的精细设计,我们的 SMMix 在训练开销更小、性能优于其他 CutMix 变体方面表现显著。特别地,SMMix 在 ImageNet-1k 上将 DeiT-T/S/B、CaiT-XXS-24/36 和 PVT-T/S/M/L 的准确率提升了超过 +1%。我们方法的泛化能力也在下游任务和分布外数据集上得到了验证。我们的项目匿名发布于 https://github.com/ChenMnZ/SMMix。

关键词

引用

@article{arxiv.2212.12977,
  title  = {SMMix: Self-Motivated Image Mixing for Vision Transformers},
  author = {Mengzhao Chen and Mingbao Lin and ZhiHang Lin and Yuxin Zhang and Fei Chao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2212.12977},
  year   = {2023}
}