中文

估计并最大化互信息用于知识蒸馏

计算机视觉与模式识别 2023-05-12 v3 信息论 math.IT

摘要

在本工作中,我们提出互信息最大化知识蒸馏(MIMKD)。我们的方法使用对比目标,同时估计并最大化教师与学生网络之间局部与全局特征表示互信息的下界。我们通过大量实验证明,这可用于通过将知识从性能更强但计算昂贵的模型迁移,来提升低容量模型的性能。这可用于生成可在低计算资源设备上运行的更优模型。我们的方法灵活,可将任意网络架构的教师网络知识蒸馏到任意学生网络。我们的实证结果表明,MIMKD 在具有不同容量、不同架构以及学生网络极低容量的广泛师生配对中优于竞争方法。通过从 ResNet-50 蒸馏知识,我们能使 ShufflenetV2 在 CIFAR100 上从 69.8% 的基线准确率提升至 74.55%。在 Imagenet 上,我们使用 ResNet-34 教师网络将 ResNet-18 从 68.88% 准确率提升至 70.32%(提升 1.44% 以上)。

关键词

引用

@article{arxiv.2110.15946,
  title  = {Estimating and Maximizing Mutual Information for Knowledge Distillation},
  author = {Aman Shrivastava and Yanjun Qi and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2110.15946},
  year   = {2023}
}