中文

Doping:一种利用稀疏结构化加性矩阵高效压缩 LSTM 模型的技术

机器学习 2021-02-16 v1

摘要

结构化矩阵(如由克罗内克积(KP)导出的矩阵)能有效压缩神经网络,但在应用于大型模型时可能导致不可接受的精度损失。本文中,我们提出 doping(掺杂)——向结构化矩阵添加一个极度稀疏矩阵——的概念。Doping 为少量参数提供了额外的自由度,使它们能够独立于固定结构而发散。为训练带有掺杂结构化矩阵的 LSTM,我们引入额外的参数矩阵并缓慢退火其稀疏度水平。然而,我们发现随着缓慢稀疏化 doping 矩阵,性能会下降,这是由于结构化矩阵与稀疏矩阵之间的共矩阵适应(CMA)。我们使用共矩阵丢弃正则化(CMR)方案来解决对这种稀疏矩阵的过度依赖。我们提供经验证据以表明 doping、CMA 和 CMR 是普遍适用于多种结构化矩阵(克罗内克积、LMF、混合矩阵分解)的概念。此外,使用掺杂克罗内克积矩阵的结果在 4 个自然语言处理应用上以较大压缩比(10–25 倍)展示了当前最优精度,且精度损失微小。掺杂 KP 压缩技术以相似精度实现了比先前最优压缩结果高 1.3–2.4 倍的压缩比,同时也大幅领先剪枝和低秩等强力替代方法(8% 或以上)。另外,我们展示了掺杂 KP 可利用当前软件栈部署于商用硬件,并实现相比基线 2.5–5.5 倍的推理运行时间加速。

关键词

引用

@article{arxiv.2102.07071,
  title  = {Doping: A technique for efficient compression of LSTM models using sparse structured additive matrices},
  author = {Urmish Thakker and Paul N. Whatmough and Zhigang Liu and Matthew Mattina and Jesse Beu},
  journal= {arXiv preprint arXiv:2102.07071},
  year   = {2021}
}

备注

Accepted to be published at MLSys 2021