中文

EA-KD:基于熵的自适应知识蒸馏

计算机视觉与模式识别 2025-08-12 v3

摘要

知识蒸馏(KD)通过从教师模型的输出或特征中迁移知识,使较小的“学生”模型模仿较大的“教师”模型。然而,大多数 KD 方法对所有样本一视同仁,忽视了每个样本学习价值的差异,从而限制了其效果。在本文中,我们提出基于熵的自适应知识蒸馏(EA-KD),一种简单而有效的即插即用 KD 方法,优先从有价值的样本中学习。EA-KD 通过策略性地结合教师和学生输出的熵来量化每个样本的学习价值,然后动态重加权蒸馏损失,以更关注高熵样本。在多种 KD 框架和任务(包括图像分类、目标检测和大型语言模型(LLM)蒸馏)上的大量实验表明,EA-KD 持续增强性能,以可忽略的计算成本实现了最先进的结果。代码见:https://github.com/cpsu00/EA-KD

关键词

引用

@article{arxiv.2311.13621,
  title  = {EA-KD: Entropy-based Adaptive Knowledge Distillation},
  author = {Chi-Ping Su and Ching-Hsun Tseng and Bin Pu and Lei Zhao and Jiewen Yang and Zhuangzhuang Chen and Shin-Jye Lee},
  journal= {arXiv preprint arXiv:2311.13621},
  year   = {2025}
}

备注

Accepted to ICCV 2025