知识蒸馏中的Logit标准化
计算机视觉与模式识别
2024-03-05 v1
摘要
知识蒸馏涉及使用共享基于温度的softmax函数将软标签从教师转移到学生。然而,教师和学生之间共享温度的假设意味着他们的logits在logit范围和方差方面必须精确匹配。这种副作用限制了学生的性能,考虑到它们之间的容量差异以及教师固有的logit关系足以让学生学习。为了解决这个问题,我们建议将温度设置为logit的加权标准差,并在应用softmax和Kullback-Leibler散度之前执行即插即用的Z-score预处理(logit标准化)。我们的预处理使学生能够专注于教师的关键logit关系,而不是要求幅度匹配,并且可以提高现有基于logit的蒸馏方法的性能。我们还展示了一个典型情况,其中教师和学生之间共享温度的传统设置无法可靠地产生真实的蒸馏评估;然而,我们的Z-score成功缓解了这一挑战。我们在CIFAR-100和ImageNet上对各种学生和教师模型进行了广泛评估,显示了其显著优越性。由我们的预处理驱动的普通知识蒸馏可以达到与最先进方法相当的性能,并且其他蒸馏变体借助我们的预处理可以获得可观的收益。
引用
@article{arxiv.2403.01427,
title = {Logit Standardization in Knowledge Distillation},
author = {Shangquan Sun and Wenqi Ren and Jingzhi Li and Rui Wang and Xiaochun Cao},
journal= {arXiv preprint arXiv:2403.01427},
year = {2024}
}
备注
10 pages, 5 figures, accepted by The The IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR 2024)