中文

关于形式语言中 LSTM 模型泛化能力的评估

计算与语言 2018-11-05 v1 人工智能 机器学习

摘要

循环神经网络(RNNs)在理论上是图灵完备的,并已成为语言处理的主导模型。然而,关于其语言学习能力仍存在不确定性。在本文中,我们通过实验评估了长短期记忆网络(简单 RNN 的一种流行扩展)学习简单形式语言(特别是 anbna^nb^nanbncna^nb^nc^nanbncndna^nb^nc^nd^n)的归纳学习能力。我们研究了训练数据机制与模型容量等学习的各个方面对未观测样本泛化的影响。我们发现不同训练设置下模型性能存在显著差异,并强调在对神经网络模型的学习能力做出断言时需要仔细分析与评估。

关键词

引用

@article{arxiv.1811.01001,
  title  = {On Evaluating the Generalization of LSTM Models in Formal Languages},
  author = {Mirac Suzgun and Yonatan Belinkov and Stuart M. Shieber},
  journal= {arXiv preprint arXiv:1811.01001},
  year   = {2018}
}

备注

Proceedings of the Society for Computation in Linguistics (SCiL) 2019