中文

用于少样本知识蒸馏的渐进式网络嫁接

计算机视觉与模式识别 2020-12-14 v2 人工智能 机器学习

摘要

知识蒸馏在深度模型压缩中已展现出令人鼓舞的性能。然而,大多数现有方法需要大量标注数据来完成知识迁移,使得模型压缩成为一个繁琐且昂贵的过程。在本文中,我们研究实用的少样本知识蒸馏场景,其中我们假设每个类别仅有少量无人工标注的样本可用。为此,我们引入了一种专为少样本数据设计的、有原则的两阶段蒸馏方案。第一步,我们将学生模块逐个嫁接到教师网络上,并学习与教师其他模块参数交织在一起的嫁接模块参数。第二步,将训练好的学生模块逐步连接,然后整体嫁接到教师网络上,使已学习的学生模块彼此适应并最终替代教师网络。实验表明,我们的方法仅使用少量无标注样本,便在 CIFAR10、CIFAR100 和 ILSVRC-2012 上取得了令人满意的结果。在 CIFAR10 和 CIFAR100 上,我们的性能甚至与使用完整数据集的知识蒸馏方案相当。源代码可在 https://github.com/zju-vipa/NetGraft 获取。

关键词

引用

@article{arxiv.2012.04915,
  title  = {Progressive Network Grafting for Few-Shot Knowledge Distillation},
  author = {Chengchao Shen and Xinchao Wang and Youtan Yin and Jie Song and Sihui Luo and Mingli Song},
  journal= {arXiv preprint arXiv:2012.04915},
  year   = {2020}
}

备注

Accepted to AAAI 2021