ProdSumNet:通过和之积矩阵分解减少深度神经网络中的模型参数
机器学习
2019-05-27 v2 机器学习
摘要
我们考虑一种通用框架,通过将线性算子分解为更简单线性算子的和之积,以减少深度学习网络中的可训练模型参数数量。近期提出的深度学习架构如 CNN、KFC、膨胀 CNN 等都被纳入该框架,并我们阐明了该框架内的其他神经网络架构类型。我们表明,在 MNIST 和 Fashion MNIST 上可用相对较少的可训练参数获得良好精度。此外,由于卷积层的实现资源密集,我们考虑在变换域中一种免去卷积层需求的方法。该通用框架相较于先前方法的一个优势是可训练参数数量不固定且可任意变化。特别地,我们阐明了变化可训练变量数量与相应错误率之间的权衡。例如,通过在含超过 3×10^6 可训练参数的 MNIST 参考 CNN 架构上使用该分解,我们仅用 3554 个可训练参数便获得了 98.44% 的精度。
引用
@article{arxiv.1809.02209,
title = {ProdSumNet: reducing model parameters in deep neural networks via product-of-sums matrix decompositions},
author = {Chai Wah Wu},
journal= {arXiv preprint arXiv:1809.02209},
year = {2019}
}
备注
10 pages, 4 figures