中文

词类表征在基于下一词预测训练的深度神经网络中自发涌现

计算与语言 2023-02-16 v1 人工智能 神经元与认知

摘要

人类如何学习语言,以及第一语言究竟能否被习得?这些根本问题至今仍争论不休。在当代语言学中,有两大学派给出了截然相反的回答。根据乔姆斯基的普遍语法理论,语言无法被习得,因为儿童在其语言环境中接触到的数据不足。相反,基于使用的语言模型假定语言结构与语言运用之间存在深刻联系,尤其认为语境心理加工与心理表征具有认知容量,可在各个层面捕捉实际语言运用的复杂性。典型例子是句法,即词组合为句子等更大单元的规则。通常,句法规则被表述为词类序列。然而,词类究竟是如普遍语法所暗示的那样为先天固有,还是在语言习得过程中如基于使用的取向所建议的那样涌现,仍不明确。本文从机器学习与自然语言处理视角探讨此问题。具体而言,我们训练了一个人工深度神经网络,以连续词序列作为输入来预测下一个词,随后分析了神经网络隐藏层中涌现的激活模式。引人注目的是,我们发现九词输入序列的内部表征会根据待预测输出的第十个词的词类进行聚类,尽管该神经网络在训练期间未接收任何关于句法规则或词类的显式信息。这一令人惊讶的结果提示,即使在人脑中,诸如词类这样的抽象表征范畴也可能作为语言习得过程中预测性编码与加工的自然结果而涌现。

关键词

引用

@article{arxiv.2302.07588,
  title  = {Word class representations spontaneously emerge in a deep neural network trained on next word prediction},
  author = {Kishore Surendra and Achim Schilling and Paul Stoewer and Andreas Maier and Patrick Krauss},
  journal= {arXiv preprint arXiv:2302.07588},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2301.06755