判别且一致的表示蒸馏
计算机视觉与模式识别
2025-05-14 v5 人工智能
摘要
知识蒸馏(KD)旨在将知识从大型 teacher 模型转移到较小的 student 模型。虽然对比学习在自监督学习中表现出色,通过创建判别性表示实现了此目标,但其在知识蒸馏中的应用仍有限,主要关注判别性,忽略了 teacher 模型所捕获的结构关系。为此,我们提出判别且一致蒸馏(DCD),其采用对比损失和一致性正则化以最小化 teacher 和 student 表示分布之间的差异。我们的方法引入可在训练期间适应的可学习温度和偏置参数,以平衡这些互补目标,取代对比学习方法中常用的固定超参数。通过在 CIFAR-100 和 ImageNet ILSVRC-2012 上的大量实验,我们展示 DCD 实现了最先进的性能,student 模型有时甚至超过 teacher 的准确率。进一步,我们表明 DCD 学习的表示在迁移到 Tiny ImageNet 和 STL-10 时表现出优越的跨数据集泛化能力。
引用
@article{arxiv.2407.11802,
title = {Discriminative and Consistent Representation Distillation},
author = {Nikolaos Giakoumoglou and Tania Stathaki},
journal= {arXiv preprint arXiv:2407.11802},
year = {2025}
}
备注
Preprint. Code: https://github.com/giakoumoglou/distillers, Supplementary: https://giakoumoglou.com/src/dcd_suppl.pdf