LSTM 网络的分解技巧
计算与语言
2018-02-27 v3 神经与进化计算
机器学习
摘要
我们提出了两种简单的方法来减少参数数量并加速大型长短期记忆网络 (LSTM) 的训练:第一种是将 LSTM 矩阵“通过设计进行矩阵分解”为两个较小矩阵的乘积,第二种是将 LSTM 矩阵及其输入和状态划分为独立的组。这两种方法都使我们能够显著更快地将大型 LSTM 网络训练至接近 state-of-the-art 的困惑度,同时使用显著更少的 RNN 参数。
引用
@article{arxiv.1703.10722,
title = {Factorization tricks for LSTM networks},
author = {Oleksii Kuchaiev and Boris Ginsburg},
journal= {arXiv preprint arXiv:1703.10722},
year = {2018}
}
备注
accepted to ICLR 2017 Workshop