弱到强知识蒸馏加速视觉学习
计算机视觉与模式识别
2026-04-23 v2
摘要
大规模视觉学习日益受到训练成本的制约。现有的知识蒸馏方法通常是从更强的教师模型向较弱的学生模型迁移知识,以实现模型压缩或最终精度提升。我们转而研究利用蒸馏来加速强学生模型的训练。我们提出了一种可泛化的即插即用方案:冻结一个较弱的教师模型,仅在训练早期应用蒸馏,一旦学生模型达到并超越教师水平的表现即关闭蒸馏。在 ImageNet 和 CIFAR 分类任务上,该策略能更早达到目标阈值,以训练轮数衡量,加速比最高可达 4.8 倍。我们证实该方法可泛化至其他任务:在 COCO 数据集的目标检测任务中,以训练轮数衡量,实现了 1.7 倍的加速;在 CIFAR-10 数据集的扩散生成任务中,以步数衡量,达到目标 FID 的时间提前了 2.5 倍。这些发现验证了我们的方法是一种通用的视觉学习加速机制。
引用
@article{arxiv.2604.15451,
title = {Weak-to-Strong Knowledge Distillation Accelerates Visual Learning},
author = {Baiang Li and Wenhao Chai and Felix Heide},
journal= {arXiv preprint arXiv:2604.15451},
year = {2026}
}
备注
18 pages, 7 figures