TransMix:面向视觉 Transformer 的混合注意力机制
计算机视觉与模式识别
2021-11-19 v1
摘要
基于 Mixup 的数据增强已被发现能在训练期间有效泛化模型,特别是对于视觉 Transformer(ViTs),因为它们容易过拟合。然而,先前基于 mixup 的方法有一个潜在的先验知识,即目标的线性插值比例应保持与输入插值中提出的比例相同。这可能导致一种奇怪的现象:有时由于增强中的随机过程,混合图像中不存在有效对象,但标签空间中仍有响应。为了弥合输入空间与标签空间之间的这种差距,我们提出 TransMix,它基于视觉 Transformer 的注意力图来混合标签。如果相应的输入图像被注意力图赋予更高权重,则标签的置信度将更大。TransMix 极其简单,只需几行代码即可实现,不会给基于 ViT 的模型引入任何额外参数和 FLOPs。实验结果表明,我们的方法能在 ImageNet 分类上持续改进各种规模的基于 ViT 的模型。在 ImageNet 上使用 TransMix 预训练后,基于 ViT 的模型还展示出对语义分割、目标检测和实例分割更好的可迁移性。TransMix 在 4 个不同基准上评估时也表现出更强的鲁棒性。代码将在 https://github.com/Beckschen/TransMix 公开提供。
引用
@article{arxiv.2111.09833,
title = {TransMix: Attend to Mix for Vision Transformers},
author = {Jie-Neng Chen and Shuyang Sun and Ju He and Philip Torr and Alan Yuille and Song Bai},
journal= {arXiv preprint arXiv:2111.09833},
year = {2021}
}
备注
Code will be made publicly available at https://github.com/Beckschen/TransMix