中文

基于条件互信息的知识蒸馏贝叶斯条件分布估计

机器学习 2024-03-11 v2 计算机视觉与模式识别 信息论 math.IT

摘要

人们认为,在知识蒸馏(KD)中,教师的作用是为学生训练过程中使用的未知贝叶斯条件概率分布(BCPD)提供一个估计。传统上,该估计通过使用最大对数似然(MLL)方法训练教师来获得。为了改进用于 KD 的这一估计,本文我们将条件互信息(CMI)的概念引入 BCPD 的估计中,并提出了一种称为最大 CMI(MCMI)方法的新型估计器。具体而言,在 MCMI 估计中,训练教师时同时最大化教师的对数似然和 CMI。通过 Eigen-CAM,进一步表明最大化教师的 CMI 值能使教师捕获图像簇中更多的上下文信息。通过进行一系列全面的实验,我们证明,在各种最先进的 KD 框架中,使用通过 MCMI 估计训练的教师而非通过 MLL 估计训练的教师,学生的分类准确率持续提高,增益高达 3.32%。这表明 MCMI 方法提供的教师 BCPD 估计比 MLL 方法提供的更准确。此外,我们表明,在零样本和少样本设置下,学生准确率的这种提升更为显著。值得注意的是,当学生仅能获得 5% 的训练样本时(少样本),学生准确率的增益高达 5.72%;对于一个被省略的类别(零样本),准确率从 0% 提高到高达 84%。代码可在 https://github.com/iclr2024mcmi/ICLRMCMI 获取。

关键词

引用

@article{arxiv.2401.08732,
  title  = {Bayes Conditional Distribution Estimation for Knowledge Distillation Based on Conditional Mutual Information},
  author = {Linfeng Ye and Shayan Mohajer Hamidi and Renhao Tan and En-Hui Yang},
  journal= {arXiv preprint arXiv:2401.08732},
  year   = {2024}
}

备注

32 pages, 19 figures, Published as a conference paper at ICLR 2024