基于多头部注意力网络的图知识蒸馏
机器学习
2019-07-10 v2 机器学习
摘要
知识蒸馏(KD)是一种通过蒸馏大型教师网络(TN)的知识并将蒸馏所得知识迁移到小型学生网络(SN)中,从而从小型 SN 获得最优性能的技术。由于卷积神经网络(CNN)在 KD 中的作用是嵌入数据集以良好执行给定任务,获取考虑数据内关系的知识非常重要。传统 KD 方法集中于以数据单元为单位蒸馏知识。据我们所知,尚未提出任何以数据集为单元蒸馏信息的 KD 方法。因此,本文提出一种新方法,利用注意力网络从 TN 蒸馏基于数据集的知识。TN 的嵌入过程知识通过多头部注意力(MHA)蒸馏为图,并执行多任务学习以向学生网络赋予关系归纳偏置。MHA 可提供关于源数据集的清晰信息,能大幅提升 SN 的性能。实验结果表明,所提方法在 CIFAR100 上比单独 SN 高 7.05%,比当前最优(SOTA)高 2.46%。
引用
@article{arxiv.1907.02226,
title = {Graph-based Knowledge Distillation by Multi-head Attention Network},
author = {Seunghyun Lee and Byung Cheol Song},
journal= {arXiv preprint arXiv:1907.02226},
year = {2019}
}
备注
Accepted to BMVC 2019 as an oral presentation