基于稀疏正则化的 RNN 架构学习
计算与语言
2019-09-09 v1 机器学习
机器学习
摘要
用于自然语言处理的神经模型通常使用大量参数以达到最先进的性能,这可能导致过高的内存占用和运行时间增加。我们提出了一种结构学习方法,用于学习稀疏、参数高效的 NLP 模型。我们的方法将组套索应用于理性 RNN(Peng et al., 2018),这是一类与加权有限状态自动机(WFSA)紧密相关的模型。我们利用理性 RNN 权重的自然分组特性,使得组套索惩罚直接移除 WFSA 状态,从而大幅减少模型中的参数数量。我们在多个情感分析数据集上使用 GloVe 和 BERT 嵌入进行的实验表明,我们的方法学习到的神经结构参数更少,且性能不逊于参数丰富的基线模型。我们的方法还突显了理性 RNN 的可解释特性。我们证明,稀疏化此类模型使其更易于可视化,并展示了在剪枝超过 90% 的权重后,仅依赖少至三个 WFSA 的模型。我们公开发布了代码。
引用
@article{arxiv.1909.03011,
title = {RNN Architecture Learning with Sparse Regularization},
author = {Jesse Dodge and Roy Schwartz and Hao Peng and Noah A. Smith},
journal= {arXiv preprint arXiv:1909.03011},
year = {2019}
}