基于相关距离与网络剪枝的鲁棒性增强知识蒸馏
计算机视觉与模式识别
2025-05-20 v2
摘要
通过知识蒸馏(KD)将知识从更复杂的模型(即教师模型)迁移到高效轻量模型(即学生模型),可提升后者的性能。然而,现有多数 KD 技术依赖 Kullback-Leibler (KL) 散度,存在一定局限。首先,若教师分布具有高熵,KL 散度的模式平均特性会阻碍充足目标信息的迁移。其次,当教师分布低熵时,KL 散度倾向于过度关注特定模式,无法向学生传递大量有价值知识。因此,在处理含大量混淆或困难样本的数据集时,学生模型难以习得充足知识,导致性能不佳。此外,我们先前观察到,旨在提升模型泛化能力的数据增强在以往 KD 方法中可能产生负面影响。为此,我们提出一种利用相关距离与网络剪枝的鲁棒性增强知识蒸馏(R2KD),使 KD 能有效结合数据增强以提升性能。在 CIFAR-100、FGVR、TinyImagenet 和 ImageNet 等多个数据集上的大量实验表明,本方法优于当前最先进方法。
引用
@article{arxiv.2311.13934,
title = {Robustness-Reinforced Knowledge Distillation with Correlation Distance and Network Pruning},
author = {Seonghak Kim and Gyeongdo Ham and Yucheol Cho and Daeshik Kim},
journal= {arXiv preprint arXiv:2311.13934},
year = {2025}
}
备注
13 pages, 7 figures