中文

LSTM:搜索空间奥德赛

神经与进化计算 2017-10-05 v2 机器学习

摘要

自 1995 年提出以来,已经提出了多种长短期记忆(LSTM)循环神经网络变体。近年来,这些网络已成为各种机器学习问题的最先进的模型。这重新引起了人们对典型 LSTM 变体中各种计算组件的作用和实用性的兴趣。在本文中,我们首次对八种 LSTM 变体在三个代表性任务——语音识别、手写识别和多声部音乐建模——上进行了大规模分析。所有 LSTM 变体在每个任务上的超参数均使用随机搜索分别进行优化,其重要性使用强大的 fANOVA 框架进行评估。总计,我们总结了 5400 次实验运行(约 15 年的 CPU 时间),这使我们的研究成为同类研究中规模最大的。我们的结果表明,没有任何变体能在标准 LSTM 架构上取得显著改进,并证明了遗忘门和输出激活函数是其最关键的组件。我们进一步观察到所研究的超参数几乎相互独立,并得出了高效调整它们的指导方针。

关键词

引用

@article{arxiv.1503.04069,
  title  = {LSTM: A Search Space Odyssey},
  author = {Klaus Greff and Rupesh Kumar Srivastava and Jan Koutník and Bas R. Steunebrink and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:1503.04069},
  year   = {2017}
}

备注

12 pages, 6 figures