基于教师助理的原位知识蒸馏用于改进灵活深度神经网络的训练
信号处理
2021-05-19 v1
摘要
深度神经网络(DNNs)在各种机器学习任务中取得了巨大成功。然而,大多数现有的强大 DNN 模型计算昂贵且内存需求高,阻碍了它们在低内存和计算资源的设备中的部署,或在具有严格延迟要求的应用中的部署。因此,最近提出了几种资源自适应或灵活的方法,同时训练一个大模型和若干个资源特定的子模型。原位知识蒸馏(IPKD)已成为训练这些模型的流行方法,其包括将来自较大模型(教师)的知识蒸馏到所有其他子模型(学生)。在这项工作中,引入了一种称为带教师助理的原位知识蒸馏(IPKD-TA)的新型通用训练方法,其中子模型本身成为教导更小子模型的教师助理。我们使用两个最先进的灵活模型(MSDNet 和 Slimmable MobileNet-V1)和两个流行的图像分类基准(CIFAR-10 和 CIFAR-100)评估了所提出的 IPKD-TA 训练方法。我们的结果表明,IPKD-TA 与现有最先进水平相当,同时在大多数情况下改进了它。
引用
@article{arxiv.2105.08369,
title = {Inplace knowledge distillation with teacher assistant for improved training of flexible deep neural networks},
author = {Alexey Ozerov and Ngoc Duong},
journal= {arXiv preprint arXiv:2105.08369},
year = {2021}
}