基于排序机制的参数自由Logit蒸馏
信号处理
2025-08-25 v1 机器学习
图像与视频处理
摘要
知识蒸馏(KD)旨在通过软标签从教师(较大)模型蒸馏知识到学生(较小)模型。通常情况下,模型的性能取决于准确度,而准确度通过标签进行衡量。然而,现有的KD方法通常使用教师的原始分布,忽略了错误预测的潜在价值。这可能与通过交叉熵损失进行硬标签学习的动机相矛盾,导致在某些样本上进行次优的知识蒸馏。为了解决此问题,我们提出了一种通过排序机制处理Logit的新方法。具体而言,我们的方法有两个目标:(1)基于标签修正教师的错误预测,(2)一次性根据优先级排序对分布进行重新排序。作为一种易于使用、即插即用的预处理,我们的排序方法可以有效地应用于现有的基于Logit的KD方法。在CIFAR-100和ImageNet数据集上的大量实验表明,我们方法的有效性。
引用
@article{arxiv.2508.16544,
title = {Parameter-Free Logit Distillation via Sorting Mechanism},
author = {Stephen Ekaputra Limantoro},
journal= {arXiv preprint arXiv:2508.16544},
year = {2025}
}
备注
Accepted in IEEE Signal Processing Letters 2025