中文

通过矩阵乘积算子压缩深度神经网络

机器学习 2020-07-01 v2 计算机视觉与模式识别 神经与进化计算 计算物理 量子物理

摘要

深度神经网络是对信号的多层映射的一种参数化,由许多交替排列的线性和非线性变换构成。通常用于全连接层以及卷积层的线性变换包含了大部分被训练和存储的变分参数。压缩深度神经网络以减少其变分参数数量但不损失其预测能力,是一个重要且具有挑战性的问题,有助于建立高效训练这些参数的优化方案并降低过拟合风险。在此我们表明,该问题可以通过用矩阵乘积算子(MPO)表示线性变换来有效解决,MPO 是物理学中最初提出用于刻画一维量子态中短程纠缠的张量网络。我们在五个典型的神经网络(包括 FC2、LeNet-5、VGG、ResNet 和 DenseNet)上以及两个广泛使用的数据集(即 MNIST 和 CIFAR-10)上测试了该方法,发现这种 MPO 表示确实在输入和输出信号之间建立了忠实且高效的映射,能够以大幅减少的参数数量保持甚至提高预测精度。我们的方法极大简化了深度学习中的表示,并为建立一个可能更简单、更廉价但更高效的现代神经网络框架开辟了可能的路径。

关键词

引用

@article{arxiv.1904.06194,
  title  = {Compressing deep neural networks by matrix product operators},
  author = {Ze-Feng Gao and Song Cheng and Rong-Qiang He and Z. Y. Xie and Hui-Hai Zhao and Zhong-Yi Lu and Tao Xiang},
  journal= {arXiv preprint arXiv:1904.06194},
  year   = {2020}
}

备注

8+9 pages, 3+7 figures, 2+11 tables