深度网络中的零样本知识蒸馏
机器学习
2019-05-21 v1 计算机视觉与模式识别
机器学习
摘要
知识蒸馏处理从一个高容量源模型(教师)训练一个较小模型(学生)以保留其大部分性能的问题。现有方法使用训练数据或从中提取的元数据来训练学生。然而,如果教师所训练的数据集非常大或存在隐私或安全问题(例如生物特征或医疗数据),访问该数据集可能并不总是可行。因此,在本文中,我们提出了一种新颖的无数据方法从教师训练学生。我们甚至不使用任何元数据,而是从复杂的教师模型中合成数据印象,并将其作为原始训练数据样本的替代物,通过知识蒸馏将其学习迁移给学生。因此,我们将我们的方法称为“零样本知识蒸馏(Zero-Shot Knowledge Distillation)”,并证明我们的框架在多个基准数据集上取得了与使用实际训练数据样本进行蒸馏所达到的相当泛化性能。
引用
@article{arxiv.1905.08114,
title = {Zero-Shot Knowledge Distillation in Deep Networks},
author = {Gaurav Kumar Nayak and Konda Reddy Mopuri and Vaisakh Shaj and R. Venkatesh Babu and Anirban Chakraborty},
journal= {arXiv preprint arXiv:1905.08114},
year = {2019}
}
备注
Accepted in ICML 2019, codes will be available at https://github.com/vcl-iisc/ZSKD