中文

局部到整体知识蒸馏:渐进式蒸馏分解知识更好地促进学生网络

计算机视觉与模式识别 2021-09-28 v1 硬件体系结构

摘要

知识蒸馏领域精心设计了各种类型的知识,以缩小紧凑学生网络与大规模教师网络之间的性能差距。这些现有的蒸馏方法仅关注知识质量的提升,却忽略了知识数量对蒸馏过程的显著影响。与从固定的教师计算图中提取知识的传统蒸馏方法不同,本文从知识数量的新视角探索了一个不可忽视的研究方向,以进一步提高知识蒸馏的有效性。我们引入了知识分解的新概念,并进一步提出了局部到整体知识蒸馏(PWKD)范式。具体而言,我们将教师网络重构为具有相同深度但通道宽度递增的权重共享子网络,并联合训练这些子网络以获得分解的知识(具有更多通道的子网络代表更多的知识)。然后,学生在多个训练阶段从预训练的教师中提取局部到整体的知识,其中利用循环学习率来加速收敛。通常,PWKD 可以作为一个插件,与现有的离线知识蒸馏方法兼容。为了验证 PWKD 的有效性,我们在两个基准数据集上进行了实验:CIFAR-100 和 ImageNet,综合评估结果表明,PWKD 无需复杂的技巧即可持续改进现有的知识蒸馏方法。

关键词

引用

@article{arxiv.2109.12506,
  title  = {A Simple Self-calibration Method for The Internal Time Synchronization of MEMS LiDAR},
  author = {Yu Zhang and Xiaoguang Di and Shiyu Yan and Bin Zhang and Baoling Qi and Chunhui Wang},
  journal= {arXiv preprint arXiv:2109.12506},
  year   = {2021}
}

备注

9 pages, 8 figures,