中文

KDExplainer:一种用于解释知识蒸馏的面向任务的注意力模型

计算机视觉与模式识别 2021-05-13 v2

摘要

知识蒸馏(KD)近来已成为学习紧凑型深度神经网络(DNN)的一种有效方案。尽管取得了令人鼓舞的结果,但解释 KD 行为的原理在很大程度上仍未被充分研究。在本文中,我们引入了一种新颖的面向任务的注意力模型,称为 KDExplainer,以阐明 vanilla KD 背后的工作机制。KDExplainer 的核心是一个分层专家混合(HME),其中多类分类被重新表述为多任务二分类。通过将知识从自由形式的预训练 DNN 蒸馏到 KDExplainer,我们观察到 KD 隐式地调节了不同子任务之间的知识冲突,并且实际上比标签平滑提供了更多的东西。基于这些发现,我们进一步引入了一个可移植工具,称为虚拟注意力模块(VAM),它可以无缝集成到各种 DNN 中,以在 KD 下增强其性能。实验结果表明,在可忽略的额外成本下,配备 VAM 的学生模型在不同基准上始终优于其无 VAM 的对应模型。此外,当与其他 KD 方法结合时,尽管 VAM 仅受 vanilla KD 启发,它仍能有效提升结果。代码可在 https://github.com/zju-vipa/KDExplainer 获取。

关键词

引用

@article{arxiv.2105.04181,
  title  = {KDExplainer: A Task-oriented Attention Model for Explaining Knowledge Distillation},
  author = {Mengqi Xue and Jie Song and Xinchao Wang and Ying Chen and Xingen Wang and Mingli Song},
  journal= {arXiv preprint arXiv:2105.04181},
  year   = {2021}
}

备注

7 pages, 4 figures, accepted to IJCAI 2021