基于共享分类器的自适应教学知识蒸馏
计算机视觉与模式识别
2024-06-17 v2 机器学习
摘要
知识蒸馏(KD)是一种用于将知识从过参数化的教师网络转移到参数较少的学生网络的技术,从而最小化由此产生的性能损失。KD方法可分为离线方法和在线方法。离线KD利用强大的预训练教师网络,而在线KD允许动态调整教师网络以增强学生网络的学习效果。最近发现,共享教师网络的分类器可以显著提升学生网络的性能,同时仅带来网络参数数量的最小增加。基于这些见解,我们提出了基于共享分类器的自适应教学(ATSC)。在ATSC中,预训练的教师网络根据自身能力进行自我调整,以更好地适应学生网络的学习需求,而学生网络则受益于共享分类器,从而提升其性能。此外,我们将ATSC扩展到多教师环境。我们进行了大量实验,证明了所提出的KD方法的有效性。我们的方法在单教师和多教师场景下的CIFAR-100和ImageNet数据集上均取得了最先进的结果,且所需模型参数数量增加不多。源代码可在 https://github.com/random2314235/ATSC 公开获取。
引用
@article{arxiv.2406.08528,
title = {Adaptive Teaching with Shared Classifier for Knowledge Distillation},
author = {Jaeyeon Jang and Young-Ik Kim and Jisu Lim and Hyeonseong Lee},
journal= {arXiv preprint arXiv:2406.08528},
year = {2024}
}