中文

自适应噪声注入:一种用于 RNN 的结构扩展正则化方法

计算与语言 2021-03-18 v2 机器学习

摘要

原始 LSTM 已成为词级语言建模中最具潜力的架构之一,像其他循环神经网络一样,过拟合始终是其有效性的关键障碍。现有的噪声注入正则化引入固定强度的随机噪声,这在整个训练过程中抑制了 RNN 的学习。本文中,我们提出一种称为自适应噪声注入(ANI)的新的结构扩展正则化方法,其将额外 RNN 分支的输出视为一种自适应噪声并注入到主分支 RNN 输出中。由于自适应噪声可随训练过程得到改善,其负面效应可被削弱甚至转化为正向效应,以进一步提升主分支 RNN 的表达能力。因此,ANI 可在训练早期正则化 RNN,并在后期进一步促进其训练性能。我们在三个广泛使用的语料库 PTB、WT2 和 WT103 上进行了实验,结果验证了 ANI 的正则化与促进训练性能的双重作用。此外,我们设计了一系列仿真实验以探究可能导致 ANI 正则化效应的原因,发现配备 ANI 的 LSTM 在训练过程中针对参数更新错误的鲁棒性可得到增强。

关键词

引用

@article{arxiv.1907.10885,
  title  = {Adaptive Noise Injection: A Structure-Expanding Regularization for RNN},
  author = {Rui Li and Kai Shuang and Mengyu Gu and Sen Su},
  journal= {arXiv preprint arXiv:1907.10885},
  year   = {2021}
}

备注

Recently, we find the theory "extending model can play the role of regularization"doesn't hold on other NLP tasks' datasets. Now, we are looking for a new theory to explain the effectiveness of ANI.We don't have an alternative version yet, so we choose to withdraw it