神经网络压缩综述
机器学习
2020-08-04 v2 机器学习
摘要
训练至收敛的过参数化网络在计算机视觉和自然语言处理等领域展现出令人印象深刻的性能。在这些领域中的显著任务上推进SOTA(state of the art,最优性能)对应于这些模型变得越来越大,并且由于内存与存储需求不断增加(更不用说更大的碳足迹),机器学习从业者越来越难以使用。因此,近年来模型压缩技术复苏,特别是针对深度卷积神经网络和基于自注意力(self-attention)的网络如Transformer。故此,本文及时综述了深度神经网络的旧有与当前压缩技术,包括剪枝、量化、张量分解、知识蒸馏及其组合。我们假设读者对深度学习架构有基本了解\footnote{深度学习入门见~\citet{goodfellow2016deep}},即循环神经网络(Recurrent Neural Networks,RNNs)\citep[(RNNs)][]{rumelhart1985learning,hochreiter1997long}、卷积神经网络\citep{fukushima1980neocognitron}\footnote{最新综述见\citet{khan2019survey}}以及基于自注意力的网络\citep{vaswani2017attention}\footnote{自注意力网络概览见~\citet{chaudhari2019attentive}.}\footnote{更多细节及其在自然语言处理中的使用见~\citet{hu2019introductory}}。所讨论的大部分论文至少是在这些DNN架构之一背景下提出的。
引用
@article{arxiv.2006.03669,
title = {An Overview of Neural Network Compression},
author = {James O' Neill},
journal= {arXiv preprint arXiv:2006.03669},
year = {2020}
}
备注
53 pages