中文

基于 Tucker 张量层的深度神经网络压缩与可解释性:从基本原理到张量值反向传播

机器学习 2020-01-07 v2 计算机视觉与模式识别 信号处理

摘要

本工作旨在帮助解决深度神经网络(DNNs)应用中的两个主要障碍,即过多的可训练参数及其物理可解释性。这是通过一种基于所提出的 Tucker 张量层(TTL)的张量值方法实现的,作为 DNNs 稠密权重矩阵的替代方案。这使我们能够将通用 DNNs 的权重矩阵视为高阶权重张量的矩阵展开。借助张量分解的压缩特性,我们得以引入一种新颖且高效的框架,利用权重张量的多向本质来大幅减少 DNN 参数数量。我们还通过将矩阵导数的概念推广到张量,在 TTL 框架内推导了张量值反向传播算法。由此,Tucker 分解的物理可解释性被用以通过对各因子矩阵计算梯度来获得对神经网络训练的物理解释。所提框架在合成数据以及基准数据集 MNIST、Fashion-MNIST 和 CIFAR-10 上进行了验证。总体而言,通过提供训练中每个数据特征的相对重要性,TTL 反向传播被证明有助于缓解 NNs 固有的“黑箱”性质。实验还表明,TTL 在 MNIST 和 Fashion-MNIST 上实现了 66.63 倍的压缩,同时通过对 VGG-16 网络进行简化,在性能相当的情况下实现了 10% 的训练时间加速。

关键词

引用

@article{arxiv.1903.06133,
  title  = {Compression and Interpretability of Deep Neural Networks via Tucker Tensor Layer: From First Principles to Tensor Valued Back-Propagation},
  author = {Giuseppe G. Calvi and Ahmad Moniri and Mahmoud Mahfouz and Qibin Zhao and Danilo P. Mandic},
  journal= {arXiv preprint arXiv:1903.06133},
  year   = {2020}
}