中文

基于神经网络的序列到序列学习

计算与语言 2014-12-16 v3 机器学习

摘要

深度神经网络 (DNN) 是强大的模型,已在困难的学习任务上取得了卓越性能。尽管 DNN 在拥有大量标注训练集时表现良好,但它们无法用于将序列映射到序列。在本文中,我们提出了一种通用的端到端序列学习方法,该方法对序列结构的假设极少。我们的方法使用多层长短期记忆 (LSTM) 网络将输入序列映射为固定维度的向量,然后使用另一个深度 LSTM 从该向量解码目标序列。我们的主要结果是,在 WMT'14 数据集的英法翻译任务上,LSTM 生成的翻译在整个测试集上的 BLEU 得分为 34.8,其中 LSTM 的 BLEU 得分因未登录词而受到惩罚。此外,LSTM 在处理长句子时没有困难。作为对比,基于短语的统计机器翻译 (SMT) 系统在同一数据集上的 BLEU 得分为 33.3。当我们使用 LSTM 对上述 SMT 系统生成的 1000 个假设进行重排序时,其 BLEU 得分提升至 36.5,接近该任务此前的最佳结果。LSTM 还学习到了合理的短语和句子表示,这些表示对词序敏感,且对主动语态和被动语态具有相对不变性。最后,我们发现反转所有源句子(而非目标句子)中的词序显著提高了 LSTM 的性能,因为这样做在源句子和目标句子之间引入了许多短期依赖关系,使得优化问题更容易求解。

关键词

引用

@article{arxiv.1409.3215,
  title  = {Sequence to Sequence Learning with Neural Networks},
  author = {Ilya Sutskever and Oriol Vinyals and Quoc V. Le},
  journal= {arXiv preprint arXiv:1409.3215},
  year   = {2014}
}

备注

9 pages