中文

NormKD:用于知识蒸馏的归一化对数几率

计算机视觉与模式识别 2023-08-02 v1

摘要

基于对数几率(logit)的知识蒸馏近年受关注较少,因为基于特征的方法在大多数情况下表现更好。然而,当我们重新研究温度这一用于软化对数几率输出的关键超参数时,发现它仍有未开发的潜力。在以往大多数工作中,它在整个蒸馏过程中被设为固定值。但是,由于不同样本的对数几率分布差异很大,仅靠单一温度无法将它们软化到同等程度,这可能使以往工作对每一样本的知识迁移不充分。本文中,我们重新研究超参数温度,并指出当其取单一值时,无法充分蒸馏每一样本的知识。为解决此问题,我们提出归一化知识蒸馏(NormKD),旨在根据样本对数几率分布的特征为每一样本定制温度。与原始 KD 相比,NormKD 几乎不增加额外计算或存储成本,但在 CIFAR-100 和 ImageNet 图像分类上表现显著更好。此外,NormKD 可轻松应用于其他基于对数几率的方法并取得更好性能,可接近甚至优于基于特征的方法。

关键词

引用

@article{arxiv.2308.00520,
  title  = {NormKD: Normalized Logits for Knowledge Distillation},
  author = {Zhihao Chi and Tu Zheng and Hengjia Li and Zheng Yang and Boxi Wu and Binbin Lin and Deng Cai},
  journal= {arXiv preprint arXiv:2308.00520},
  year   = {2023}
}