位置自适应知识蒸馏
计算机视觉与模式识别
2022-05-06 v1 人工智能
机器学习
摘要
知识蒸馏 (KD) 已成为压缩深度神经网络的一种成熟范式。进行知识蒸馏的典型方式是在教师网络的监督下训练学生网络,以利用教师网络中一个或多个位置(即层)的知识。蒸馏位置一旦指定,对于所有训练样本,在整个蒸馏过程中都不会改变。在这项工作中,我们认为蒸馏位置应当自适应于训练样本和蒸馏轮次。因此我们提出了一种新的蒸馏策略,称为位置自适应 KD (SAKD),以在整个人蒸馏周期内,对每个样本在每次训练迭代中自适应地确定教师网络中的蒸馏位置。由于 SAKD 实际上关注“在哪里蒸馏”而非大多数现有工作广泛研究的“蒸馏什么”,它可无缝集成到现有蒸馏方法中以进一步提升其性能。我们使用 10 种最先进(state-of-the-art)蒸馏器进行了大量实验,以证明 SAKD 在同构和异构蒸馏设置下提升其蒸馏性能的有效性。代码可在 https://github.com/zju-vipa/spot-adaptive-pytorch 获取。
引用
@article{arxiv.2205.02399,
title = {Spot-adaptive Knowledge Distillation},
author = {Jie Song and Ying Chen and Jingwen Ye and Mingli Song},
journal= {arXiv preprint arXiv:2205.02399},
year = {2022}
}
备注
12 pages, 8 figures