中文

基于扩散模型的教师引导学生自知蒸馏

计算机视觉与模式识别 2026-02-03 v1

摘要

现有知识蒸馏(KD)方法通常通过探索有意义的特征处理和损失函数,在教师和学生之间对齐特征信息。然而,由于教师与学生特征分布的差异,学生模型可能学习到不兼容的信息。为此,我们提出教师引导学生扩散自蒸馏方法,称为DSKD。我们不采用直接的教师-学生对齐,而是利用教师分类器引导去噪学生特征的采样过程,采用轻量级扩散模型。随后,我们提出一种基于局部敏感哈希(LSH)的特征蒸馏方法,用于原始特征与去噪后学生特征之间的蒸馏。去噪后的学生特征封装了教师知识,可被视为新的教师角色。如此一来,DSKD方法消除了教师与学生在映射方式和特征分布上的差异,同时能够从教师那里学习有意义的知识。在视觉识别任务上的实验表明,DSKD在 various 模型和数据集上均显著优于现有KD方法。我们的代码已附于补充材料中。

关键词

引用

@article{arxiv.2602.02107,
  title  = {Teacher-Guided Student Self-Knowledge Distillation Using Diffusion Model},
  author = {Yu Wang and Chuanguang Yang and Zhulin An and Weilun Feng and Jiarui Zhao and Chengqing Yu and Libo Huang and Boyu Diao and Yongjun Xu},
  journal= {arXiv preprint arXiv:2602.02107},
  year   = {2026}
}