用于在线知识蒸馏的同侪协作学习
计算机视觉与模式识别
2021-03-04 v2
摘要
传统知识蒸馏采用两阶段训练策略,将知识从高容量教师模型迁移到紧凑的学生模型,这严重依赖于预训练好的教师。近期的在线知识蒸馏通过协作学习、互学习和在线集成缓解了此限制,遵循单阶段端到端训练方式。然而,协作学习和互学习未能构建在线的容量教师,而在线集成忽略了各分支间的协作,且其logit求和阻碍了集成教师的进一步优化。在本工作中,我们提出一种新颖的用于在线知识蒸馏的同侪协作学习方法,将在线集成与网络协作整合到统一框架中。具体而言,给定一个目标网络,我们构建一个多分支网络用于训练,其中每个分支称为一个同侪(peer)。我们对输入到各同侪的数据进行多次随机增强,并利用一个额外的分类器将同侪输出的特征表示组装为同侪集成教师。这有助于将知识从高容量教师迁移到各同侪,并反过来进一步优化集成教师。同时,我们采用每个同侪的时间平均模型作为同侪均值教师,在同侪间协作迁移知识,这有助于每个同侪学习更丰富的知识,并有利于优化出具有更好泛化能力的更稳定的模型。在CIFAR-10、CIFAR-100和ImageNet上的大量实验表明,所提方法显著提升了多种骨干网络的泛化能力,并优于当前最优(SOTA)方法。
引用
@article{arxiv.2006.04147,
title = {Peer Collaborative Learning for Online Knowledge Distillation},
author = {Guile Wu and Shaogang Gong},
journal= {arXiv preprint arXiv:2006.04147},
year = {2021}
}