中文

动量对抗蒸馏:处理无数据知识蒸馏中的大分布偏移

计算机视觉与模式识别 2022-09-22 v1 人工智能

摘要

无数据知识蒸馏(DFKD)近期备受关注,因其具备在不使用训练数据的情况下将知识从教师网络迁移到学生网络的能力。其主要思想是使用生成器合成数据以训练学生。随着生成器更新,合成数据的分布会改变。若生成器与学生以对抗方式训练,这种分布偏移可能很大,导致学生遗忘其在先前步骤获得的知识。为缓解该问题,我们提出一种简单而有效的方法,称为动量对抗蒸馏(MAD),其维护生成器的指数移动平均(EMA)副本,并利用来自生成器与 EMA 生成器的合成样本训练学生。由于 EMA 生成器可视为生成器旧版本的集成,且更新时的变化通常小于生成器,在其合成样本上训练可帮助学生回忆过去知识,并防止学生过快适应生成器的新的更新。我们在包括 ImageNet 与 Places365 等大型数据集在内的六个基准数据集上的实验证明了 MAD 在处理大分布偏移问题上优于对比方法。我们的方法也比现有 DFKD 方法更具优势,且在某些情况下甚至取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.2209.10359,
  title  = {Momentum Adversarial Distillation: Handling Large Distribution Shifts in Data-Free Knowledge Distillation},
  author = {Kien Do and Hung Le and Dung Nguyen and Dang Nguyen and Haripriya Harikumar and Truyen Tran and Santu Rana and Svetha Venkatesh},
  journal= {arXiv preprint arXiv:2209.10359},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022