CKD:基于样本视角的对比知识蒸馏
计算机视觉与模式识别
2025-03-26 v2
摘要
本文提出一种简单而有效的对比知识蒸馏框架,实现样本级的逻辑对齐,同时保持语义一致性。传统的知识蒸馈方法在单个样本上过度依赖特征相似性,风险在于过拟合;而对比方法则在牺牲样本内部语义关系的代价下专注于类别间的判别。我们的 метод 将"暗知识"通过教师-学生在样本级别进行对比对齐。具体而言,本方法首先通过直接最小化单个样本内的教师-学生逻辑差异来实现样本内部对齐。随后,我们利用样本间的对比来保持跨样本的语义不相似性。通过将正对偶重新定义为来自相同样本的对齐教师-学生逻辑,将负对偶定义为跨样本的逻辑组合,我们将这些双重约束重新表述为 InfoNCE 损失框架,降低计算复杂度低于样本平方,同时消除对温度参数和大批量大小的依赖。我们在三个基准数据集上进行了全面实验,包括 CIFAR-100、ImageNet-1K 和 MS COCO 数据集,实验结果明确证明了该方法在图像分类、目标检测和实例分割任务中的有效性。
关键词
引用
@article{arxiv.2404.14109,
title = {CKD: Contrastive Knowledge Distillation from A Sample-wise Perspective},
author = {Wencheng Zhu and Xin Zhou and Pengfei Zhu and Yu Wang and Qinghua Hu},
journal= {arXiv preprint arXiv:2404.14109},
year = {2025}
}