中文

拼接以蒸馏:基于域外数据的知识蒸馏

机器学习 2021-10-29 v1 人工智能 计算机视觉与模式识别

摘要

知识蒸馏(KD)旨在构建一个紧凑的学生模型,以模仿预训练教师在目标领域中的行为。先前的 KD 方法尽管结果令人满意,但很大程度上依赖于\emph{域内}数据可用于知识迁移的前提。不幸的是,这一假设在许多实际场景中不成立,因为出于隐私或版权原因,原始训练数据甚至数据域往往不可获取。本文中,我们尝试解决一项艰巨任务,称为\emph{域外}知识蒸馏(OOD-KD),其允许我们仅使用可极低代价轻易获得的 OOD 数据来进行 KD。不得不承认,OOD-KD 本质上是一项极具挑战的任务,因为存在未知的域间隙。为此,我们引入一种简便却出奇有效的方法,称为 \textit{MosaicKD}。MosaicKD 背后的关键洞见在于:尽管全局语义可能差异显著,但来自不同域的样本共享局部模式;这些共享的局部模式可像马赛克铺贴般重新组装,以逼近域内数据并进一步缓解域差异。在 MosaicKD 中,这通过一个四方极小极大博弈实现,其中生成器、判别器、学生网络以对抗方式集体训练,部分地在预训练教师的指导下进行。我们在跨多个基准的分类与语义分割任务上验证 MosaicKD,并证明其在 OOD 数据上取得远优于最先进对应方法的结果。我们的代码见 \url{https://github.com/zju-vipa/MosaicKD}。

关键词

引用

@article{arxiv.2110.15094,
  title  = {Mosaicking to Distill: Knowledge Distillation from Out-of-Domain Data},
  author = {Gongfan Fang and Yifan Bao and Jie Song and Xinchao Wang and Donglin Xie and Chengchao Shen and Mingli Song},
  journal= {arXiv preprint arXiv:2110.15094},
  year   = {2021}
}