基于知识蒸馏的深度神经网络通道植入
计算机视觉与模式识别
2020-11-05 v1 机器学习
摘要
近年来,更深更宽的神经网络在计算机视觉任务中表现出优异的性能,但其庞大的参数量导致了计算成本增加和过拟合。已有若干方法被提出以在不降低网络性能的前提下压缩网络规模。网络剪枝可去除网络中的冗余和不必要参数。知识蒸馏可将更深更宽网络的知识迁移到更小的网络。这些方法所得小网络的性能受限于预定义网络。为打破结构限制,已提出神经架构搜索,可自动搜索网络架构。此外,还有一种动态配置方法,以子网络形式增量训练网络。本文提出一种称为植入(planting)的新型深度神经网络增量训练算法。我们的植入方法通过向初始网络各层增量增补通道,同时保持已训练参数固定,以更小参数量搜索最优网络架构从而提升网络性能。我们还提出使用知识蒸馏方法训练所植入的通道。通过迁移更深更宽网络的知识,我们能够有效且高效地生长网络。我们在 CIFAR-10/100 和 STL-10 等不同数据集上评估了所提方法的有效性。对于 STL-10 数据集,我们表明仅用较大网络 7% 的参数即可取得相当性能,并减少了少量数据引起的过拟合。
引用
@article{arxiv.2011.02390,
title = {Channel Planting for Deep Neural Networks using Knowledge Distillation},
author = {Kakeru Mitsuno and Yuichiro Nomura and Takio Kurita},
journal= {arXiv preprint arXiv:2011.02390},
year = {2020}
}
备注
Accepted to ICPR 2020