神经状态下推自动机
神经与进化计算
2019-09-23 v2 计算与语言
机器学习
摘要
为了学习复杂文法,循环神经网络(RNNs)需要充足的计算资源以确保正确的文法识别。一种广泛使用的扩展模型容量的方法是将 RNN 耦合到外部存储栈。在此,我们引入一种“神经状态”下推自动机(NSPDA),其由一个数字栈(而非模拟栈)耦合到神经网络状态机组成。我们凭经验展示了其在识别各种上下文无关文法(CFGs)中的有效性。首先,我们开发了所提出的高阶循环网络的底层机制及其对栈的操作,以及如何稳定地编程其底层下推自动机(PDA)以实现期望的有限状态网络动力学。接着,我们引入了一种针对高阶(张量)网络的噪声正则化方案——据我们所知这是此类首例——并设计了一种改进增量学习的算法。最后,我们设计了一种将文法规则插入 NSPDA 的方法,并凭经验表明该先验知识将其训练收敛时间提高了一个数量级,且在某些情况下带来更好的泛化。NSPDA 还与经典的模拟栈神经网络下推自动机(NNPDA)以及多种带或不带外部存储的一阶和二阶 RNN 进行了比较,这些模型使用不同学习算法训练。我们的结果表明,对于 Dyck(2) 语言,基于规则的先验知识对优化收敛和确保测试时对更长序列的泛化至关重要。我们观察到许多带或不带记忆但无先验知识的 RNN 在 CFGs 上无法收敛且泛化性差。
引用
@article{arxiv.1909.05233,
title = {The Neural State Pushdown Automata},
author = {Ankur Mali and Alexander Ororbia and C. Lee Giles},
journal= {arXiv preprint arXiv:1909.05233},
year = {2019}
}
备注
10 pages, 7 Table, 1 figure