中文

神经网络与乔姆斯基层级

机器学习 2023-03-01 v3 人工智能 计算与语言 形式语言与自动机理论

摘要

可靠的泛化能力是安全ML与AI的核心。然而,理解神经网络何时以及如何泛化仍是该领域最重要的未解问题之一。本工作中,我们进行了广泛的实证研究(20'910个模型,15项任务),以探究计算理论中的洞见能否预测神经网络在实践中的泛化极限。我们证明,依据乔姆斯基层级对任务分组,可让我们预测某些架构能否泛化到分布外输入。这包括负面结果:尽管模型容量足以完美拟合训练数据,但即便大量数据与训练时间也从未带来任何非平凡泛化。我们的结果表明,对于我们这一任务子集,RNN与Transformer在非正则任务上无法泛化,LSTM可解决正则与反语言任务,而仅有增强结构化记忆(如栈或记忆带)的网络能在上下文无关与上下文敏感任务上成功泛化。

关键词

引用

@article{arxiv.2207.02098,
  title  = {Neural Networks and the Chomsky Hierarchy},
  author = {Grégoire Delétang and Anian Ruoss and Jordi Grau-Moya and Tim Genewein and Li Kevin Wenliang and Elliot Catt and Chris Cundy and Marcus Hutter and Shane Legg and Joel Veness and Pedro A. Ortega},
  journal= {arXiv preprint arXiv:2207.02098},
  year   = {2023}
}