面向知识蒸馏的多任务优化
计算机视觉与模式识别
2025-08-05 v2
摘要
紧凑模型可以通过知识蒸馏(Knowledge Distillation, KD)有效训练,这是一种将知识从大型高性能教师模型转移到学生模型的技术。知识蒸馏(KD)的两个关键挑战是:1)平衡来自教师指导与任务目标的学习,以及2)处理教师模型与学生模型之间知识表示的差异。为此,我们提出了面向知识蒸馏的多任务优化方法(MoKD)。MoKD 旨在解决两个主要梯度问题:a) 梯度冲突,即任务特定梯度与蒸馏梯度方向不一致;b) 梯度主导,即某个目标的梯度主导,导致不平衡。MoKD 将 KD 重新表述为多目标优化问题,从而实现目标之间的更好平衡。此外,它引入了子空间学习框架,将特征表示投影到高维空间,以提高知识传递。我们在使用 ImageNet-1K 数据集进行图像分类和使用 COCO 数据集进行目标检测的实验中证明了 MoKD 能够超越现有方法,实现了更高的效率和最佳性能。到目前为止,我们的 MoKD 模型也实现了相对于从头训练的模型的最佳性能。
关键词
引用
@article{arxiv.2505.08170,
title = {MoKD: Multi-Task Optimization for Knowledge Distillation},
author = {Zeeshan Hayder and Ali Cheraghian and Lars Petersson and Mehrtash Harandi},
journal= {arXiv preprint arXiv:2505.08170},
year = {2025}
}
备注
Major changes to the paper and the authorship