中文

利用能量函数最大化知识蒸馏的判别能力

计算机视觉与模式识别 2025-05-23 v3

摘要

为了在真实工业应用中应用需要大量计算成本的最新计算机视觉技术,知识蒸馏方法(KDs)必不可少。现有的基于 logit 的 KDs 对数据集中所有样本施加恒定的温度缩放,限制了对每个样本自身固有知识的利用。在我们的方法中,我们根据能量分数将数据集分为两类(即低能量样本和高能量样本)。通过实验,我们确认低能量样本表现出高置信度分数,表明确定性预测,而高能量样本产生低置信度分数,意味着不确定性预测。为了通过调整非目标类预测来蒸馏最优知识,我们对低能量样本施加较高温度以创建更平滑的分布,对高能量样本施加较低温度以实现更尖锐的分布。与先前基于 logit 和基于特征的方法相比,我们基于能量的 KD(Energy KD)在各种数据集上取得了更好的性能。特别是,Energy KD 在包含许多困难样本的 CIFAR-100-LT 和 ImageNet 数据集上显示出显著改进。此外,我们提出了基于高能量的数据增强(HE-DA)以进一步提升性能。我们证明,仅增强数据集的一部分而非整个数据集可以实现更高的性能提升,这表明它可用于资源受限设备。据我们所知,本文首次尝试在知识蒸馏和数据增强中利用能量函数,我们相信它将极大促进未来研究。

关键词

引用

@article{arxiv.2311.14334,
  title  = {Maximizing Discrimination Capability of Knowledge Distillation with Energy Function},
  author = {Seonghak Kim and Gyeongdo Ham and Suin Lee and Donggon Jang and Daeshik Kim},
  journal= {arXiv preprint arXiv:2311.14334},
  year   = {2025}
}

备注

12 pages, 7 figures