中文

慢者为优:重访 LSTM 中的遗忘机制以实现更慢的信息衰减

机器学习 2021-05-14 v1

摘要

序列信息包含短程到长程的依赖关系;然而,学习长时间尺度信息一直是循环神经网络的挑战。尽管长短期记忆网络(LSTM)有所改进,其遗忘机制导致信息呈指数衰减,限制了捕捉长时间尺度信息的能力。在此,我们提出幂律遗忘门,转而学习沿更慢的幂律衰减函数遗忘信息。具体而言,新门学习控制幂律衰减因子 p,使网络能根据任务需求调整信息衰减率。我们的实验表明,带幂律遗忘门的 LSTM(pLSTM)能在图像分类、语言建模与分类任务上有效捕捉超越数百个元素的长期依赖,较原始 LSTM 提升性能。我们还通过变化 p 的初始化、将 p 设为固定值以及消融 pLSTM 网络中的单元来检视修正后的遗忘门。结果显示信息衰减可由可学习衰减因子 p 控制,使 pLSTM 取得优越性能。总之,我们发现带所提遗忘门的 LSTM 能学习长期依赖,在多个领域优于其他循环网络;此类门控机制可集成至其他架构以改进循环神经网络对长时间尺度信息的学习。

关键词

引用

@article{arxiv.2105.05944,
  title  = {Slower is Better: Revisiting the Forgetting Mechanism in LSTM for Slower Information Decay},
  author = {Hsiang-Yun Sherry Chien and Javier S. Turek and Nicole Beckage and Vy A. Vo and Christopher J. Honey and Ted L. Willke},
  journal= {arXiv preprint arXiv:2105.05944},
  year   = {2021}
}

备注

16 pages, 10 figures