中文

评估 LSTM 学习上下文无关文法的能力

计算与语言 2018-11-08 v1

摘要

虽然长短期记忆(LSTM)神经网络架构旨在捕获序列信息,但人类语言通常由层次结构组成。这引发了一个问题:LSTM 能否学习层次结构?我们使用由 LSTM 建模的两类括号的良构括号预测任务来探究这一问题。证明此类系统可被 LSTM 学习,是证明整个上下文无关语言(CFL)类也可被学习的首要步骤。我们观察到,该模型在字符数和嵌入深度方面需要指数级内存,而亚线性内存本应足够。尽管如此,该模型所做的不仅仅是记忆训练输入,它学会了如何区分相关与无关信息。另一方面,我们也观察到该模型泛化能力不佳。我们得出结论:LSTM 并未学习到相关的底层上下文无关规则,其良好的整体性能似乎是通过一种高效评估干扰变量的方式实现的。LSTM 是快速在许多自然语言任务上取得良好结果的方法,但要理解和生成自然语言,必须研究其他能更直接利用自然语言结构特性的概念。

关键词

引用

@article{arxiv.1811.02611,
  title  = {Evaluating the Ability of LSTMs to Learn Context-Free Grammars},
  author = {Luzi Sennhauser and Robert C. Berwick},
  journal= {arXiv preprint arXiv:1811.02611},
  year   = {2018}
}