化身知识蒸馏:具有不确定性的自集成教师范式
计算机视觉与模式识别
2023-11-21 v4
摘要
知识蒸馏是一种提升轻量模型性能的有效范式,尤其在存在多个教师模型时,学生模型会再次突破上限。然而,为一次性蒸馏训练多样化的教师模型并不经济。本文引入一种称为蒸馏化身(Avatars)的新概念,即由教师模型导出的推理集成模型。具体而言:(1)在蒸馏训练的每次迭代中,通过扰动变换生成多种化身。我们验证化身拥有更高的工作能力上限与教学能力上限,助力学生模型从教师模型学习多样且易接受的知识视角。(2)蒸馏过程中,我们根据原始教师与化身间统计差异的方差提出不确定性感知因子,以自适应调整化身在知识迁移中的贡献。化身知识蒸馏(AKD)从根本上不同于现有方法,并以不平等训练的创新视角进行优化。综合实验证明了我们化身机制的有效性,其在不增加额外计算成本的情况下改进了用于密集预测的最优蒸馏方法。AKD在COCO 2017目标检测上最多带来0.7 AP增益,在Cityscapes语义分割上最多带来1.83 mIoU增益。代码见 https://github.com/Gumpest/AvatarKD。
引用
@article{arxiv.2305.02722,
title = {Avatar Knowledge Distillation: Self-ensemble Teacher Paradigm with Uncertainty},
author = {Yuan Zhang and Weihua Chen and Yichen Lu and Tao Huang and Xiuyu Sun and Jian Cao},
journal= {arXiv preprint arXiv:2305.02722},
year = {2023}
}
备注
Accepted by ACM MM 2023