用于知识转移的变分信息蒸馏
计算机视觉与模式识别
2019-04-12 v1 人工智能
机器学习
摘要
将预训练于相同或相似任务的教师神经网络的知识转移给学生神经网络,可以显著提升学生神经网络的性能。现有的知识转移方法通过匹配教师网络和学生网络的激活值或相应的手工特征来实现。我们提出了一个用于知识转移的信息论框架,将知识转移表述为最大化教师网络与学生网络之间的互信息。我们在知识蒸馏和迁移学习任务上将我们的方法与现有的知识转移方法进行了比较,并表明我们的方法始终优于现有方法。我们进一步通过在 CIFAR-10 上将知识从卷积神经网络(CNN)转移到多层感知机(MLP),展示了我们的方法在异构网络架构间知识转移的优势。所得的 MLP 显著优于现有方法,并且其性能与具有单卷积层的 CNN 相当。
引用
@article{arxiv.1904.05835,
title = {Variational Information Distillation for Knowledge Transfer},
author = {Sungsoo Ahn and Shell Xu Hu and Andreas Damianou and Neil D. Lawrence and Zhenwen Dai},
journal= {arXiv preprint arXiv:1904.05835},
year = {2019}
}
备注
To appear at CVPR 2019