基于批次知识集成的自蒸馏改进 ImageNet 分类
计算机视觉与模式识别
2021-11-23 v2
摘要
近期知识蒸馏的研究发现,集成来自多个教师或学生的“暗知识”有助于为训练生成更好的软目标,但代价是显著更多的计算量和/或参数量。在本工作中,我们提出批次知识集成(BAKE),通过传播并集成同一小批次中其他样本的知识,为锚定图像生成精炼的软目标。具体而言,对于每个感兴趣的样本,知识传播根据样本间亲和力进行加权,而亲和力由当前网络在线估计。随后传播的知识可被集成以形成更好的蒸馏软目标。由此,我们的 BAKE 框架仅用单一网络即可实现跨多样本的在线知识集成,与现有知识集成方法相比仅需极小的计算与内存开销。大量实验表明,这种轻量而有效的 BAKE 持续提升了多种架构在多个数据集上的分类性能,例如 Swin-T 在 ImageNet 上以仅 +1.5% 计算开销和零额外参数取得显著的 +0.7% 增益。BAKE 不仅改进了原始基线,还在所有基准上超越了单网络 SOTA。
引用
@article{arxiv.2104.13298,
title = {Self-distillation with Batch Knowledge Ensembling Improves ImageNet Classification},
author = {Yixiao Ge and Xiao Zhang and Ching Lam Choi and Ka Chun Cheung and Peipei Zhao and Feng Zhu and Xiaogang Wang and Rui Zhao and Hongsheng Li},
journal= {arXiv preprint arXiv:2104.13298},
year = {2021}
}
备注
Project Page: https://geyixiao.com/projects/bake