将神经网络训练为形式语言识别器
计算与语言
2025-04-15 v3 机器学习
摘要
从形式语言理论的角度刻画神经网络架构的计算能力是一项至关重要的研究,因为它描述了现代 AI 推理能力的下界和上界。然而,在经验性地检验这些界时,现有工作常常在实验与它们旨在支持的正式结论之间存在偏差。问题在于形式语言理论专门针对识别器:接收字符串作为输入并判断其是否属于某语言的机器。另一方面,通常更倾向于在代理任务上评估语言模型,例如语言建模或序列到序列转导,这些任务仅在非正式意义上与底层理论相似。我们通过直接训练和评估神经网络作为字符串的二分类器来纠正这种不匹配,该方法可广泛应用于多种语言。作为其中的一部分,我们扩展了 Sn{\ae}bjarnarson 等人 (2025) 最近提出的针对正则语言进行长度控制采样的高效算法。我们针对三种神经网络架构——简单 RNN、LSTM 和因果掩码 Transformer——在乔姆斯基层级的多种语言上给出了结果。我们发现 RNN 和 LSTM 常常优于 Transformer,而辅助训练目标如语言建模可以有所帮助,尽管没有任何单一目标能在所有语言和架构上 uniformly 提升性能。我们的贡献将促进未来工作中对语言识别结论进行理论严谨的经验检验。我们已将数据集发布为名为 FLaRe(形式语言识别)的基准,并公开了代码。
引用
@article{arxiv.2411.07107,
title = {Training Neural Networks as Recognizers of Formal Languages},
author = {Alexandra Butoi and Ghazal Khalighinejad and Anej Svete and Josef Valvoda and Ryan Cotterell and Brian DuSell},
journal= {arXiv preprint arXiv:2411.07107},
year = {2025}
}
备注
44 pages, 3 figures. ICLR 2025. Official camera-ready version; applies minor corrections to previous version