中文

VanillaKD:重新审视从小规模到大规模中原始知识蒸馏的能力

计算机视觉与模式识别 2023-05-26 v1

摘要

在大规模数据集上训练的大模型所取得的巨大成功表明,规模是获得优异结果的关键要素。因此,仅基于小规模数据集为有限容量架构设计知识蒸馏(KD)方法的合理性,如今被视为亟需反思的问题。本文中,我们指出了先前 KD 方法中存在的“小数据陷阱”(small data pitfall),它导致在 ImageNet-1K 等大规模数据集上低估了原始 KD 框架的能力。具体而言,我们表明采用更强的数据增强技术和使用更大的数据集可直接缩小原始 KD 与其他精心设计的 KD 变体之间的差距。这凸显了在实际场景背景下设计和评估 KD 方法的必要性,摆脱小规模数据集的限制。我们在更复杂方案(包括更强的训练策略和不同模型容量)下对原始 KD 及其变体的考察表明,原始 KD 简洁优雅,但在大规模场景中惊人地有效。无需额外技巧,我们获得了 ImageNet 上最先进的 ResNet-50、ViT-S 和 ConvNeXtV2-T 模型,其 top-1 准确率分别达到 83.1%、84.3% 和 85.0%。PyTorch 代码与检查点可在 https://github.com/Hao840/vanillaKD 获取。

关键词

引用

@article{arxiv.2305.15781,
  title  = {VanillaKD: Revisit the Power of Vanilla Knowledge Distillation from Small Scale to Large Scale},
  author = {Zhiwei Hao and Jianyuan Guo and Kai Han and Han Hu and Chang Xu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2305.15781},
  year   = {2023}
}