半在线知识蒸馏
计算机视觉与模式识别
2021-11-24 v1
摘要
知识蒸馏是一种通过知识迁移进行模型压缩的有效且稳定的方法。常规知识蒸馏(KD)将知识从大型且充分预训练的教师网络迁移至小型学生网络,这是一个单向过程。近来,深度互学习(DML)被提出以帮助学生网络协同且同步地学习。然而,据我们所知,KD与DML从未在统一框架中联合探索以解决知识蒸馏问题。本文中,我们论证教师模型在KD中提供更可信的监督信号,而学生在DML中从教师捕获更相似的行为。基于这些观察,我们首先提出将KD与DML结合于统一框架。进一步,我们提出半在线知识蒸馏(SOKD)方法,有效提升学生与教师的性能。该方法中,我们引入DML中的同辈教学训练方式以缓解学生模仿困难,并利用KD中训练良好教师提供的监督信号。此外,我们也展示框架可轻松扩展至基于特征蒸馏的方法。在CIFAR-100与ImageNet数据集上的大量实验表明所提方法达到了最先进性能。
引用
@article{arxiv.2111.11747,
title = {Semi-Online Knowledge Distillation},
author = {Zhiqiang Liu and Yanxia Liu and Chengkai Huang},
journal= {arXiv preprint arXiv:2111.11747},
year = {2021}
}
备注
Accepted to BMVC2021