DeiT-LT:知识蒸馏在长尾数据集 Vision Transformer 训练中的反击
计算机视觉与模式识别
2024-04-04 v1 人工智能
机器学习
摘要
Vision Transformer(ViT)已成为各种计算机视觉任务的突出架构。在 ViT 中,我们将输入图像划分为 patch token,并通过一堆自注意力块进行处理。然而,与卷积神经网络(CNN)不同,ViT 简单的架构没有信息性的归纳偏置(例如局部性等)。因此,ViT 需要大量数据进行预训练。已经提出了各种数据高效方法以在平衡数据集上有效地训练 ViT。然而,关于将 ViT 用于具有长尾不平衡的数据集的文献有限。在本工作中,我们引入 DeiT-LT 来解决在长尾数据集上从头训练 ViT 的问题。在 DeiT-LT 中,我们引入了一种通过蒸馏 DIST token 从 CNN 进行蒸馏的高效有效方法,该方法使用分布外图像并重新加权蒸馏损失以增强对尾部类的关注。这导致在早期 ViT 块中学习类 CNN 的局部特征,提高了尾部类的泛化能力。此外,为了缓解过拟合,我们提出从扁平 CNN 教师进行蒸馏,这导致在所有 ViT 块中为 DIST token 学习低秩可泛化特征。通过提出的 DeiT-LT 方案,蒸馏 DIST token 成为尾部类的专家,而分类器 CLS token 成为头部类的专家。这些专家有助于在相同的 ViT 架构内使用不同的 token 集合有效地学习对应于多数类和少数类的特征。我们展示了 DeiT-LT 在从小型 CIFAR-10 LT 到大型 iNaturalist-2018 数据集上从头训练 ViT 的有效性。
引用
@article{arxiv.2404.02900,
title = {DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets},
author = {Harsh Rangwani and Pradipto Mondal and Mayank Mishra and Ashish Ramayee Asokan and R. Venkatesh Babu},
journal= {arXiv preprint arXiv:2404.02900},
year = {2024}
}
备注
CVPR 2024. Project Page: https://rangwani-harsh.github.io/DeiT-LT