GroupReduce:基于分块低秩近似的神经语言模型压缩方法
计算与语言
2018-06-20 v1 人工智能
机器学习
机器学习
摘要
模型压缩对于在资源受限设备上部署大型深度神经网络或需要实时响应的应用至关重要。作为一个案例研究,最先进的神经语言模型通常由一个或更多循环层夹在用于表示输入词符的嵌入层和用于生成输出词符的 softmax 层之间构成。对于词汇量非常大的问题,嵌入矩阵和 softmax 矩阵可占模型大小的一半以上。例如,bigLSTM 模型在拥有约 80 万词汇量的 One-Billion-Word (OBW) 数据集上取得了最先进的性能,其词嵌入和 softmax 矩阵占用超过 6GB 空间,并占模型参数的 90% 以上。本文中,我们提出 GroupReduce,一种基于词汇划分(分块)的低秩矩阵近似和词符固有频率分布(词的幂律分布)的神经语言模型压缩新方法。实验结果表明,我们的方法能显著优于低秩近似和剪枝等传统压缩方法。在 OBW 数据集上,我们的方法对嵌入和 softmax 矩阵实现了 6.6 倍压缩率,且与量化结合时可达到 26 倍压缩率,这相当于对整个模型实现 12.8 倍压缩,而困惑度下降极小。
引用
@article{arxiv.1806.06950,
title = {GroupReduce: Block-Wise Low-Rank Approximation for Neural Language Model Shrinking},
author = {Patrick H. Chen and Si Si and Yang Li and Ciprian Chelba and Cho-jui Hsieh},
journal= {arXiv preprint arXiv:1806.06950},
year = {2018}
}