中文

理解 Mixup 在知识蒸馏中的作用:一项实证研究

计算机视觉与模式识别 2022-11-10 v2

摘要

Mixup 是一种流行的数据增强技术,通过在两个给定数据样本之间进行线性插值来创建新样本,以提高训练模型的泛化能力和鲁棒性。另一方面,知识蒸馏(KD)广泛用于模型压缩和迁移学习,涉及使用较大网络的隐式知识来指导较小网络的学习。乍一看,这两种技术似乎截然不同,然而我们发现“平滑性”是两者之间的纽带,也是理解 KD 与 mixup 相互作用的关键属性。尽管已经提出了许多 mixup 变体和蒸馏方法,但关于 mixup 在知识蒸馏中作用的理解仍有待深入。在本文中,我们对 mixup 与知识蒸馏之间兼容性的各个重要维度进行了详细的实证研究。我们还通过在图像分类上的广泛分析、可视化和全面实验,在知识蒸馏的背景下审查了使用 mixup 训练的网络的行为。最后,基于我们的发现,我们提出了改进的策略来指导学生网络以增强其有效性。此外,本研究的发现为通常使用 KD 技术的研究人员和从业者提供了深刻的建议。我们的代码可在 https://github.com/hchoi71/MIX-KD 获取。

关键词

引用

@article{arxiv.2211.03946,
  title  = {Understanding the Role of Mixup in Knowledge Distillation: An Empirical Study},
  author = {Hongjun Choi and Eun Som Jeon and Ankita Shukla and Pavan Turaga},
  journal= {arXiv preprint arXiv:2211.03946},
  year   = {2022}
}

备注

To be presented at WACV 2023