语言RNN的激活正则化再探
计算与语言
2017-08-04 v1 神经与进化计算
摘要
循环神经网络 (RNNs) 是自然语言处理中许多序列任务的基本构建块。近期研究聚焦于循环 dropout 技术或自定义 RNN 单元以提升性能。这两者都可能对机器学习模型或底层 RNN 配置进行实质性修改。我们重温传统正则化技术,具体而言是对 RNN 激活的 L2 正则化以及连续隐藏状态上的慢度正则化,以提升 RNN 在语言建模任务上的性能。这两种技术仅需对现有 RNN 架构进行极小修改,并带来与更复杂正则化技术或自定义单元架构相当或更优的性能提升。这些正则化技术可在如 NVIDIA cuDNN LSTM 等优化 LSTM 实现上不经任何修改即可使用。
引用
@article{arxiv.1708.01009,
title = {Revisiting Activation Regularization for Language RNNs},
author = {Stephen Merity and Bryan McCann and Richard Socher},
journal= {arXiv preprint arXiv:1708.01009},
year = {2017}
}