重访知识蒸馏:一种继承与探索框架
机器学习
2021-07-02 v1 人工智能
计算机视觉与模式识别
摘要
知识蒸馏(KD)是一种将知识从教师模型或集成模型迁移到学生模型的流行技术。其成功通常归因于教师模型与学生模型间类分布或中间特征表示上相似性/一致性的特权信息。然而,直接推动学生模型在很大程度上模仿教师模型的概率/特征,限制了学生模型学习未被发现的知识/特征。本文提出一种新颖的继承与探索知识蒸馏框架(IE-KD),其中学生模型被拆分为两部分——继承与探索。继承部分通过相似性损失学习,将教师模型中已有知识迁移至学生模型;而探索部分通过不相似性损失鼓励学习与继承表示不同的表示。我们的 IE-KD 框架具有通用性,可轻松结合现有蒸馏或互学习方法训练深度神经网络。大量实验表明,这两部分能共同推动学生模型学习更多样化且有效的表示,且我们的 IE-KD 可作为一种通用技术提升学生网络以取得 SOTA 性能。此外,将 IE-KD 应用于两个网络的训练时,二者性能相对深度互学习均可提升。IE-KD 的代码与模型将公开于 https://github.com/yellowtownhz/IE-KD。
引用
@article{arxiv.2107.00181,
title = {Revisiting Knowledge Distillation: An Inheritance and Exploration Framework},
author = {Zhen Huang and Xu Shen and Jun Xing and Tongliang Liu and Xinmei Tian and Houqiang Li and Bing Deng and Jianqiang Huang and Xian-Sheng Hua},
journal= {arXiv preprint arXiv:2107.00181},
year = {2021}
}
备注
Accepted by CVPR 2021