权重平均在域偏移下改进知识蒸馏
机器学习
2023-09-21 v1 计算机视觉与模式识别
摘要
知识蒸馏(KD)是一种在实际深度学习应用中被广泛使用的强大模型压缩技术。它专注于训练一个小的学生网络去模仿一个更大的教师网络。尽管众所周知 KD 在独立同分布(i.i.d)设定下可改善学生网络的泛化能力,但其在域偏移下(即学生网络在训练时未见过的数据域上的性能)的表现鲜有文献关注。在本文中,我们向连接知识蒸馏与域泛化研究领域迈出一步。我们展示了域泛化文献中提出的权重平均技术,如 SWAD 与 SMA,也能改进域偏移下知识蒸馏的性能。此外,我们提出了一种简洁的权重平均策略,它不需要在训练期间在验证数据上评估,并展示当应用于 KD 时其性能与 SWAD 和 SMA 相当。我们将我们最终的蒸馏方法命名为权重平均知识蒸馏(WAKD)。
引用
@article{arxiv.2309.11446,
title = {Weight Averaging Improves Knowledge Distillation under Domain Shift},
author = {Valeriy Berezovskiy and Nikita Morozov},
journal= {arXiv preprint arXiv:2309.11446},
year = {2023}
}
备注
ICCV 2023 Workshop on Out-of-Distribution Generalization in Computer Vision (OOD-CV)