在长短期记忆内部学习内在稀疏结构
机器学习
2018-02-13 v7 人工智能
计算与语言
神经与进化计算
摘要
模型压缩对于循环神经网络(RNNs)在资源受限的用户设备以及需要快速响应大规模服务请求的业务集群中的广泛应用具有重要意义。本工作旨在通过减小 LSTM 单元内基本结构(包括输入更新、门、隐藏状态、细胞状态和输出)的规模,来学习结构稀疏的长短期记忆(LSTM)。独立地减小基本结构的规模会导致它们之间维度不一致,从而产生无效的 LSTM 单元。为克服该问题,我们提出 LSTM 中的内在稀疏结构(ISS)。移除 ISS 的一个分量将同时使所有基本结构的规模减一,从而始终保持维度一致性。通过在 LSTM 单元内学习 ISS,所获得的 LSTM 在保持规则性的同时具有小得多的基结构。基于组 Lasso 正则化,我们的方法实现了 10.59 倍加速,且不损失 Penn TreeBank 数据集语言建模的任何困惑度。它还通过仅含 2.69M 参数的紧凑模型在 SQuAD 数据集的机器问答任务上得到了成功评估。我们的方法被成功扩展到非 LSTM 的 RNN,如循环高速网络(RHNs)。我们的源代码公开于 https://github.com/wenwei202/iss-rnns
引用
@article{arxiv.1709.05027,
title = {Learning Intrinsic Sparse Structures within Long Short-Term Memory},
author = {Wei Wen and Yuxiong He and Samyam Rajbhandari and Minjia Zhang and Wenhan Wang and Fang Liu and Bin Hu and Yiran Chen and Hai Li},
journal= {arXiv preprint arXiv:1709.05027},
year = {2018}
}
备注
Published in ICLR 2018 ( the Sixth International Conference on Learning Representations)