中文

大语言模型并非自然语言模型:它们是语料库模型

计算与语言 2022-06-16 v2 机器学习

摘要

自然语言处理(NLP)已成为当前人工智能热潮中的领先应用领域之一。迁移学习使得在语言建模任务上训练的大型深度学习神经网络几乎在所有下游语言任务中大幅提升了性能。有趣的是,当语言模型使用包含软件代码的数据进行训练时,它们展现出从自然语言规范生成可用计算机代码的卓越能力。我们认为,这对于“消除性神经模型是对我们认知理解的根本重构、因其消除了对生成性短语结构语法等符号抽象的需求”这一主张造成了难题。由于编程语言的语法在设计上由短语结构语法决定,能够生成语法化代码的神经模型显然无法为编程语言的理论基础提供信息。神经模型在涉及明确符号系统的任务上表现良好的事实,证明它们不能被用作“语言及其他认知系统并非符号系统”的论据。最后,我们作为推论指出,“语言模型”这一术语具有误导性,并提议采用工作术语“语料库模型”取而代之,其更好地反映了模型的起源与内容。

关键词

引用

@article{arxiv.2112.07055,
  title  = {Large Language Models are not Models of Natural Language: they are Corpus Models},
  author = {Csaba Veres},
  journal= {arXiv preprint arXiv:2112.07055},
  year   = {2022}
}