中文

Co-advise:跨归纳偏置蒸馏

计算机视觉与模式识别 2021-06-24 v1 机器学习

摘要

Transformer 近期从自然语言处理领域被引入,作为基于卷积的神经网络在视觉学习任务中有前景的替代方案。然而,在训练数据不足(如 ImageNet)时其优势会退化。为使其具备实用价值,我们提出一种新颖的基于蒸馏的方法来训练视觉 Transformer。与以往仅提供重型基于卷积的教师模型不同,我们引入具有不同架构归纳偏置(如卷积与内卷)的轻量教师模型来协同指导(co-advise)学生 Transformer。关键在于,尽管在不同归纳偏置的教师模型在同一数据集上训练,它们获得了不同的知识,而这些不同的知识在蒸馏过程中互补并提升了学生的性能。借助这种跨归纳偏置蒸馏方法,我们的视觉 Transformer(称为 CivT)在 ImageNet 上优于所有同架构的先前 Transformer。

关键词

引用

@article{arxiv.2106.12378,
  title  = {Co-advise: Cross Inductive Bias Distillation},
  author = {Sucheng Ren and Zhengqi Gao and Tianyu Hua and Zihui Xue and Yonglong Tian and Shengfeng He and Hang Zhao},
  journal= {arXiv preprint arXiv:2106.12378},
  year   = {2021}
}