中文

用于蒸馏的知识扩散

计算机视觉与模式识别 2023-12-05 v2 人工智能

摘要

教师与学生间的表征差距是知识蒸馏(KD)中一个新兴课题。为缩小差距并提升性能,现有方法常诉诸复杂的训练方案、损失函数与特征对齐,这些均具任务特定与特征特定性。本文指出此类方法的本质在于丢弃特征中的噪声信息并蒸馏有价值信息,提出一种新颖KD方法DiffKD,利用扩散模型显式去噪并匹配特征。我们的方法基于如下观察:因学生模型容量较小,学生特征通常比教师特征含更多噪声。为此,我们提出使用由教师特征训练的扩散模型对学生特征去噪,从而在精炼干净特征与教师特征间实现更佳蒸馏。此外,我们引入带线性自编码器的轻量级扩散模型以降低计算成本,以及自适应噪声匹配模块以提升去噪性能。大量实验表明,DiffKD在各类型特征上均有效,并在图像分类、目标检测与语义分割任务上一致取得最先进性能。代码见 https://github.com/hunto/DiffKD。

关键词

引用

@article{arxiv.2305.15712,
  title  = {Knowledge Diffusion for Distillation},
  author = {Tao Huang and Yuan Zhang and Mingkai Zheng and Shan You and Fei Wang and Chen Qian and Chang Xu},
  journal= {arXiv preprint arXiv:2305.15712},
  year   = {2023}
}

备注

NeurIPS 2023