中文

利用即插即用的Kendall $\tau$排序损失增强Logits蒸馏

计算机视觉与模式识别 2025-06-17 v2

摘要

知识蒸馏通常最小化教师和学生logits之间的Kullback-Leibler (KL)散度。然而,优化KL散度对学生来说可能具有挑战性,并且常常导致次优解。我们进一步证明,KL散度诱导的梯度与教师logits的幅度成比例,从而减少了对低概率通道的更新。这种不平衡削弱了类间信息的传递,进而限制了学生可实现的性能提升。为了缓解这一问题,我们提出了一种基于Kendall τ\tau系数的即插即用辅助排序损失,它可以无缝集成到任何基于logits的蒸馏框架中。它提供类间关系信息,同时将梯度重新平衡到低概率通道。我们证明,所提出的排序损失在很大程度上对通道缩放不变,并且优化了与KL散度目标一致的目标,使其成为自然补充而非替代。在CIFAR-100、ImageNet和COCO数据集上,以及各种CNN和ViT师生架构组合上的大量实验表明,我们的即插即用排序损失持续提升了多个蒸馏基线的性能。代码可在https://github.com/OvernighTea/RankingLoss-KD获取。

关键词

引用

@article{arxiv.2409.17823,
  title  = {Enhancing Logits Distillation with Plug\&Play Kendall's $\tau$ Ranking Loss},
  author = {Yuchen Guan and Runxi Cheng and Kang Liu and Chun Yuan},
  journal= {arXiv preprint arXiv:2409.17823},
  year   = {2025}
}