泛化至关重要:通过参数杂交平摊损失极小点以实现高效在线知识蒸馏
计算机视觉与模式识别
2023-03-28 v1
摘要
大多数现有在线知识蒸馏(OKD)技术通常需要复杂模块来产生多样知识以提升学生的泛化能力。本文致力于充分利用多模型设置而非精心设计的模块,以实现具备优异泛化性能的蒸馏效果。一般而言,模型泛化可反映于损失景观的平坦度。由于对多模型参数取平均可找到更平坦的极小点,我们受此启发将这一过程扩展至 OKD 中多学生模型的采样凸组合。具体而言,通过在每个训练批次中线性加权学生参数,我们构建混合权重模型(HWM)以表示所涉学生周围的参数。HWM 的监督损失可估计学生周围整个区域的景观曲率,从而显式度量泛化。因此我们将 HWM 的损失整合进学生训练,并提出一种通过参数杂交的 novel OKD 框架(OKDPH)以促进更平坦极小点并获得鲁棒解。考虑到参数冗余可能导致 HWM 崩溃,我们进一步引入融合操作以保持学生的高相似性。相较于最先进(SOTA)的 OKD 方法及寻求平坦极小点的 SOTA 方法,我们的 OKDPH 以更少参数取得更高性能,使 OKD 具备轻量与鲁棒特性。我们的代码公开于 https://github.com/tianlizhang/OKDPH。
引用
@article{arxiv.2303.14666,
title = {Generalization Matters: Loss Minima Flattening via Parameter Hybridization for Efficient Online Knowledge Distillation},
author = {Tianli Zhang and Mengqi Xue and Jiangtao Zhang and Haofei Zhang and Yu Wang and Lechao Cheng and Jie Song and Mingli Song},
journal= {arXiv preprint arXiv:2303.14666},
year = {2023}
}
备注
Accepted by cvpr2023