低秩直通神经网络
机器学习
2018-07-10 v3 神经与进化计算
摘要
多种常见的深度学习架构,如 LSTM、GRU、ResNet 和 Highway Networks,采用状态直通连接,支持具有高前馈深度或许多时间步递归的训练。这些“直通网络”架构还能够将网络状态大小与网络参数数量解耦,这一可能性已由 Sak2014 通过其 LSTM 的低秩参数化进行研究。本工作中我们扩展了这一研究方向,提出了用于直通网络的有效、低秩以及低秩加对角矩阵参数化,其利用该解耦特性,在保持记忆容量的同时降低网络的数据复杂度和内存需求。这在低资源环境中尤其有益,因为它支持具有紧凑参数化且不易过拟合的表达性模型。我们在多个任务上给出了有竞争力的实验结果,包括语言建模以及在序列随机置换 MNIST 分类上接近最先进水平的结果,后者在自然数据上是一项困难任务。
引用
@article{arxiv.1603.03116,
title = {Low-rank passthrough neural networks},
author = {Antonio Valerio Miceli Barone},
journal= {arXiv preprint arXiv:1603.03116},
year = {2018}
}
备注
12 pages, 2 figures