中文

掩码在视觉 Transformer 高效监督知识蒸馏中的作用

机器学习 2024-09-30 v4 计算机视觉与模式识别

摘要

知识蒸馏是一种训练轻量级视觉模型的有效方法。然而,获取教师模型对训练样本的监督往往代价高昂,尤其来自视觉 Transformer(ViTs)等大规模模型时。本文开发了一个简单框架以降低 ViT 蒸馏的监督成本:对教师输入的 token 掩去一部分。通过掩码输入 token,可跳过与掩码 token 相关的计算,而无需改动教师参数或架构。我们发现,以最低学生注意力分数掩码图像块极为有效,在不损失学生准确率的前提下节省至多 50% 教师 FLOPs,而其他掩码准则导致次优的效率收益。通过深入分析,我们揭示学生引导的掩码为学生提供了良好的课程,使教师监督在早期更易遵循、后期更具挑战。

关键词

引用

@article{arxiv.2302.10494,
  title  = {The Role of Masking for Efficient Supervised Knowledge Distillation of Vision Transformers},
  author = {Seungwoo Son and Jegwang Ryu and Namhoon Lee and Jaeho Lee},
  journal= {arXiv preprint arXiv:2302.10494},
  year   = {2024}
}

备注

ECCV 2024