中文

MEAL:通过对抗学习实现多模型集成

计算机视觉与模式识别 2019-07-26 v2 人工智能 机器学习

摘要

性能最佳的深度神经模型通常是多个基础网络的集成。遗憾的是,存储这些众多网络所需空间以及测试时执行它们所需的时间,阻碍了它们在测试集规模庞大(例如 ImageNet)的应用中的使用。在本文中,我们提出一种将大型复杂已训练集成压缩为单一网络的方法,其中来自多种已训练深度神经网络(DNN)的知识被蒸馏并迁移到单一 DNN。为了从不同的已训练(教师)模型中蒸馏多样知识,我们提出使用基于对抗的学习策略,其中我们定义块级训练损失来引导和优化预定义的学生网络以恢复教师模型中的知识,同时促使判别器网络区分教师与学生特征。所提出的通过对抗学习迁移蒸馏知识的集成方法(MEAL)具有三个重要优势:(1)利用判别器学习蒸馏知识的学生网络比原始模型优化得更好;(2)通过单次前向传播实现快速推理,而性能甚至优于多原始模型的传统集成;(3)学生网络可以从具有任意结构的教师模型中学习蒸馏知识。在 CIFAR-10/100、SVHN 和 ImageNet 数据集上的大量实验证明了我们 MEAL 方法的有效性。在 ImageNet 上,我们基于 ResNet-50 的 MEAL 取得了 21.79%/5.99% 的 top-1/5 验证误差,比原始模型分别高出 2.06%/1.14%。代码和模型可在 https://github.com/AaronHeee/MEAL 获取。

关键词

引用

@article{arxiv.1812.02425,
  title  = {MEAL: Multi-Model Ensemble via Adversarial Learning},
  author = {Zhiqiang Shen and Zhankui He and Xiangyang Xue},
  journal= {arXiv preprint arXiv:1812.02425},
  year   = {2019}
}

备注

To appear in AAAI 2019. Code and models are available at: https://github.com/AaronHeee/MEAL