用于少样本知识蒸馏的渐进式网络嫁接
计算机视觉与模式识别
2020-12-14 v2 人工智能
机器学习
摘要
知识蒸馏在深度模型压缩中已展现出令人鼓舞的性能。然而,大多数现有方法需要大量标注数据来完成知识迁移,使得模型压缩成为一个繁琐且昂贵的过程。在本文中,我们研究实用的少样本知识蒸馏场景,其中我们假设每个类别仅有少量无人工标注的样本可用。为此,我们引入了一种专为少样本数据设计的、有原则的两阶段蒸馏方案。第一步,我们将学生模块逐个嫁接到教师网络上,并学习与教师其他模块参数交织在一起的嫁接模块参数。第二步,将训练好的学生模块逐步连接,然后整体嫁接到教师网络上,使已学习的学生模块彼此适应并最终替代教师网络。实验表明,我们的方法仅使用少量无标注样本,便在 CIFAR10、CIFAR100 和 ILSVRC-2012 上取得了令人满意的结果。在 CIFAR10 和 CIFAR100 上,我们的性能甚至与使用完整数据集的知识蒸馏方案相当。源代码可在 https://github.com/zju-vipa/NetGraft 获取。
引用
@article{arxiv.2012.04915,
title = {Progressive Network Grafting for Few-Shot Knowledge Distillation},
author = {Chengchao Shen and Xinchao Wang and Youtan Yin and Jie Song and Sihui Luo and Mingli Song},
journal= {arXiv preprint arXiv:2012.04915},
year = {2020}
}
备注
Accepted to AAAI 2021