泛化教师网络以实现跨学生架构的有效知识蒸馏
机器学习
2025-01-09 v2 人工智能
摘要
知识蒸馏(KD)是一种模型压缩方法,涉及训练一个紧凑的学生模型来模仿性能更优的教师模型。然而,两个模型之间的架构能力差距限制了知识迁移的有效性。针对此问题,以往的工作侧重于定制教师-学生配对以提高兼容性,但这是一个计算成本高昂的过程,每当任一模型发生变化时都需要重复进行。因此,当需要将一个教师模型压缩为多个不同的学生模型以部署在具有不同资源约束的多种设备上时,这些方法不切实际。在这项工作中,我们提出了通用教师网络(GTN),一种一次性的KD感知训练方法,用于训练一个通用教师,使其能够有效地向从给定架构池中采样的任何学生模型迁移知识。为此,我们将学生架构池表示为一个超网络,并调整通用教师以匹配从该超网络中采样的不同学生架构的能力。实验评估表明,我们的方法既提高了整体KD的有效性,又将通用教师的训练成本分摊到池中的所有学生模型上。
关键词
引用
@article{arxiv.2407.16040,
title = {Generalizing Teacher Networks for Effective Knowledge Distillation Across Student Architectures},
author = {Kuluhan Binici and Weiming Wu and Tulika Mitra},
journal= {arXiv preprint arXiv:2407.16040},
year = {2025}
}
备注
British Machine Vision Conference (BMVC 24)