中文

近乎白板:探查在无分词文本上训练的字级神经语言模型的语言知识

计算与语言 2019-06-19 v1

摘要

循环神经网络 (RNNs) 在许多自然语言处理任务中已达到引人注目的性能。这重新引发了关于这些通用序列处理装置是否在诱导真正的语言知识的兴趣。然而,几乎所有当前的分析研究都以已知词的词汇表初始化 RNN,并在训练期间向其输入已分词的文本。我们提出了一项多语言研究,考察以字级语言模型形式训练、且输入数据去除了词边界的 RNN 中所编码的语言知识。这些网络面临更艰难且更具认知现实性的任务,必须基于输入统计从零发现任何有用的语言单元。结果表明,我们“近乎白板”的 RNN 大多能够解决直觉上以词级知识为前提的形态、句法与语义任务,并且它们确实在某种程度上学会了追踪词边界。我们的研究为关于语言学习与使用中显式、刚性词词典之必要性的推测打开了大门。

关键词

引用

@article{arxiv.1906.07285,
  title  = {Tabula nearly rasa: Probing the Linguistic Knowledge of Character-Level Neural Language Models Trained on Unsegmented Text},
  author = {Michael Hahn and Marco Baroni},
  journal= {arXiv preprint arXiv:1906.07285},
  year   = {2019}
}

备注

Accepted by Transactions of the Association for Computational Linguistics