循环神经语言模型表达能力的下界
计算与语言
2024-06-19 v2
摘要
大型神经语言模型(LM)最近的成功和普及要求对其计算能力进行深入理解。通过LM的表示能力来描述其计算能力是一个活跃的研究领域。然而,对神经LM表示能力的研究主要集中在它们识别形式语言的能力上。例如,具有Heaviside激活函数的循环神经网络(RNN)与正则语言(即由有限状态自动机(FSA)定义的语言)紧密相关。然而,这样的结果未能描述RNN语言模型(LM)的能力,而RNN LM在定义上是字符串上的分布。我们通过将RNN LM与概率FSA联系起来,重新审视RNN LM的表示能力,并证明具有线性有界精度的RNN LM可以表达任意正则LM。
引用
@article{arxiv.2405.19222,
title = {Lower Bounds on the Expressivity of Recurrent Neural Language Models},
author = {Anej Svete and Franz Nowak and Anisha Mohamed Sahabdeen and Ryan Cotterell},
journal= {arXiv preprint arXiv:2405.19222},
year = {2024}
}