中文

判别且一致的表示蒸馏

计算机视觉与模式识别 2025-05-14 v5 人工智能

摘要

知识蒸馏(KD)旨在将知识从大型 teacher 模型转移到较小的 student 模型。虽然对比学习在自监督学习中表现出色,通过创建判别性表示实现了此目标,但其在知识蒸馏中的应用仍有限,主要关注判别性,忽略了 teacher 模型所捕获的结构关系。为此,我们提出判别且一致蒸馏(DCD),其采用对比损失和一致性正则化以最小化 teacher 和 student 表示分布之间的差异。我们的方法引入可在训练期间适应的可学习温度和偏置参数,以平衡这些互补目标,取代对比学习方法中常用的固定超参数。通过在 CIFAR-100 和 ImageNet ILSVRC-2012 上的大量实验,我们展示 DCD 实现了最先进的性能,student 模型有时甚至超过 teacher 的准确率。进一步,我们表明 DCD 学习的表示在迁移到 Tiny ImageNet 和 STL-10 时表现出优越的跨数据集泛化能力。

关键词

引用

@article{arxiv.2407.11802,
  title  = {Discriminative and Consistent Representation Distillation},
  author = {Nikolaos Giakoumoglou and Tania Stathaki},
  journal= {arXiv preprint arXiv:2407.11802},
  year   = {2025}
}

备注

Preprint. Code: https://github.com/giakoumoglou/distillers, Supplementary: https://giakoumoglou.com/src/dcd_suppl.pdf