视觉 Transformer 的令牌-标签对齐
计算机视觉与模式识别
2022-11-30 v2 人工智能
机器学习
摘要
数据混合策略(如 CutMix)已展现出极大提升卷积神经网络(CNNs)性能的能力。它们将两幅图像混合作为训练输入,并以相同比例赋予混合标签。尽管其对视觉 Transformer(ViTs)有效,我们识别出一种抑制了数据混合策略潜力的令牌波动现象。我们通过实验观察到,输入令牌的贡献在前向传播中波动,这可能引发输出令牌中不同的混合比例。因此,由原始数据混合策略计算的训练目标可能不准确,导致训练效果减弱。为此,我们提出令牌-标签对齐(TL-Align)方法,追踪变换后令牌与原始令牌间的对应关系,以维持每个令牌的标签。我们复用各层已计算的注意力以实现高效的令牌-标签对齐,仅引入可忽略的额外训练开销。大量实验表明,我们的方法提升了 ViTs 在图像分类、语义分割、目标检测与迁移学习任务上的性能。代码见:https://github.com/Euphoria16/TL-Align。
引用
@article{arxiv.2210.06455,
title = {Token-Label Alignment for Vision Transformers},
author = {Han Xiao and Wenzhao Zheng and Zheng Zhu and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2210.06455},
year = {2022}
}
备注
Source code available at https://github.com/Euphoria16/TL-Align