深度神经网络的滤波器嫁接:缘由、方法与培育
机器学习
2021-01-18 v2 人工智能
摘要
滤波器是现代卷积神经网络(CNNs)中的关键组件。然而,由于 CNNs 通常是过参数化的,预训练网络总是包含一些无效(不重要)的滤波器。这些滤波器具有相对较小的 范数且对输出贡献甚微(\textbf{缘由})。虽然滤波器剪枝出于效率考虑移除了这些无效滤波器,我们倾向于重新激活它们以提升 CNNs 的表征能力。本文中,我们引入滤波器嫁接(\textbf{方法})来实现该目标。激活过程通过将外部信息(权重)嫁接到无效滤波器中进行。为了更好地执行嫁接,我们提出了一种衡量滤波器信息量的新准则以及一种自适应加权策略来平衡网络间嫁接的信息。嫁接操作后,网络相较于初始状态具有更少的无效滤波器,赋予模型更强的表征能力。同时,由于嫁接在所有参与的网络上互为进行,我们发现嫁接在提升无效滤波器时可能丢失有效滤波器的信息。为在有效和无效滤波器上均获得普遍提升,我们以蒸馏补偿嫁接(\textbf{培育})以克服嫁接的缺陷。我们在分类和识别任务上进行了大量实验以展示我们方法的优越性。代码见 \textcolor{black}{\emph{https://github.com/fxmeng/filter-grafting}}。
引用
@article{arxiv.2004.12311,
title = {Filter Grafting for Deep Neural Networks: Reason, Method, and Cultivation},
author = {Hao Cheng and Fanxu Meng and Ke Li and Yuting Gao and Guangming Lu and Xing Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2004.12311},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2001.05868