中文

Wasserstein对比表示蒸馏

机器学习 2021-03-30 v2 计算机视觉与模式识别

摘要

知识蒸馏(KD)的主要目标是将教师网络所学模型中的信息封装进学生网络,后者比前者更为紧凑。现有工作,例如使用Kullback-Leibler散度进行蒸馏,可能未能捕获教师网络中的重要结构知识,且往往缺乏特征泛化能力,尤其在教师与学生为应对不同分类任务而构建的情况下。我们提出Wasserstein对比表示蒸馏(WCoRD),其利用Wasserstein距离的 primal 与 dual 形式进行KD。dual形式用于全局知识迁移,产生一个对比学习目标,最大化教师与学生网络间互信息的下界。primal形式用于 mini-batch 内的局部对比知识迁移,有效匹配教师与学生网络间特征的分布。实验表明,所提出的WCoRD方法在特权信息蒸馏、模型压缩与跨模态迁移上优于最先进方法。

关键词

引用

@article{arxiv.2012.08674,
  title  = {Wasserstein Contrastive Representation Distillation},
  author = {Liqun Chen and Dong Wang and Zhe Gan and Jingjing Liu and Ricardo Henao and Lawrence Carin},
  journal= {arXiv preprint arXiv:2012.08674},
  year   = {2021}
}

备注

Accepted by CVPR 2021