中文

通过跨模态教师融合丰富知识蒸馏

计算机视觉与模式识别 2025-11-13 v1

摘要

多教师知识蒸馏 (KD) 作为比传统单教师方法更有效的技术,通过 logits 或特征匹配将专家教师的知识传递给紧凑的学生模型。然而,大多数现有方法缺乏知识的多样性,仅依赖单一的视觉信息,忽视了跨模态表征的潜在价值。本文探索了将 CLIP 的视觉-语言知识作为额外监督来源用于 KD 的可能性,这一领域仍然基本未被探索。我们提出了一个简单而有效的框架,将常规教师的 logits 和特征与 CLIP 的 logits 和特征融合。通过融合 CLIP 的多提示文本指导,融合后的监督能够捕获数据特定和语义丰富的视觉线索。除准确率外,分析表明融合教师产生的预测更加自信且更可靠,显著增加自信且正确的案例,同时减少自信错误的案例。此外,CLIP 的融合细化了整个 logits 分布,为非目标类别产生语义上有意义的概率,从而提高了类别间的一致性和蒸馏质量。尽管方法简单,提出的 Enriching Knowledge Distillation (RichKD) 方法在多个基准测试上 consistently 超过大多数现有基线,在分布迁移和输入损坏情况下的鲁棒性也更强。

关键词

引用

@article{arxiv.2511.09286,
  title  = {Enriching Knowledge Distillation with Cross-Modal Teacher Fusion},
  author = {Amir M. Mansourian and Amir Mohammad Babaei and Shohreh Kasaei},
  journal= {arXiv preprint arXiv:2511.09286},
  year   = {2025}
}

备注

11 pages, 5 figures, 8 tables