中文

面向跨任务知识蒸馏的投影学习

计算机视觉与模式识别 2024-11-28 v2 人工智能

摘要

传统的知识蒸馏(KD)依赖于一个在目标任务上训练有素的教师模型,但这并非总是可用。在这种情况下,可以使用跨任务蒸馏,从而能够利用任何在不同任务上训练的教师模型。然而,许多 KD 方法在应用于这种跨任务设置时被证明是无效的。为了解决这一局限性,我们提出了一个简单的修改:使用反向投影。我们证明,通过学习忽略任何可能降低学生模型性能的任务特定特征,这种标准投影器的即插即用替代方案是有效的。我们发现,这一简单的修改足以将许多 KD 方法扩展到教师和学生任务可能截然不同的跨任务设置中。这样做,与传统投影相比,我们在跨任务设置中获得了高达 1.9% 的提升,且没有额外成本。即使使用随机初始化的教师模型,我们的方法在深度估计、图像翻译和语义分割等各种任务上也能获得显著的性能提升(高达 7%),尽管缺乏任何可迁移的已学知识。为了对这一结果提供概念性和分析性的见解,我们展示了使用反向投影可以将蒸馏损失分解为知识迁移和谱正则化两个分量。通过这一分析,我们还能提出一种新颖的正则化损失,实现无教师蒸馏,在 ImageNet 上性能提升高达 8.57%,且无需额外的训练成本。

关键词

引用

@article{arxiv.2403.14494,
  title  = {Learning to Project for Cross-Task Knowledge Distillation},
  author = {Dylan Auty and Roy Miles and Benedikt Kolbeinsson and Krystian Mikolajczyk},
  journal= {arXiv preprint arXiv:2403.14494},
  year   = {2024}
}

备注

BMVC 2024