知识蒸馏中基于 Logits 相关性的自适应温度
机器学习
2025-03-13 v1 计算机视觉与模式识别
摘要
知识蒸馏是一种模仿深度学习模型所具有的性能,同时减小另一个模型大小的技术。它利用一个模型的输出来训练另一个具有相当准确率的模型。这两个不同的模型类似于人类社会中信息传递的方式,一个充当“教师”,另一个充当“学生”。Softmax 通过将 logits 转换为概率分布,在将模型生成的 logits 相互比较中发挥作用。它通过一个名为温度的参数进行压缩,将教师的 logits 传递给学生。调节该变量可以增强蒸馏性能。尽管只有该参数有助于 logits 的交互,但温度如何促进信息传递尚不清楚。在本文中,我们提出了一种计算温度的新方法。我们的方法仅参考教师模型生成的最大 logit,与现有方法相比减少了计算时间。我们的方法在标准基准数据集上的不同学生和教师模型中显示出有希望的结果。使用温度的算法可以通过插入这种动态方法获得改进。此外,蒸馏过程的近似收敛于两个模型的 logits 相关性。这强化了先前的论点,即蒸馏传达了 logits 的相关性。我们报告称,在测试中,与常用的静态值相比,这种近似算法产生了更高的温度。
关键词
引用
@article{arxiv.2503.09030,
title = {Adaptive Temperature Based on Logits Correlation in Knowledge Distillation},
author = {Kazuhiro Matsuyama and Usman Anjum and Satoko Matsuyama and Tetsuo Shoda and Justin Zhan},
journal= {arXiv preprint arXiv:2503.09030},
year = {2025}
}