中文

神经语言模型对人类实时理解行为的预测能力

计算与语言 2020-06-04 v1

摘要

人类的阅读行为与自然语言的统计特性相调谐:人类受试者阅读一个词所需的时间可由该词在语境中概率的估计值预测。然而,何种计算架构最能刻画人类实时部署的、决定阅读行为特征的期望,仍是一个开放问题。在此,我们测试了二十余个模型,独立操控计算架构与训练数据集规模,考察它们的下一词期望在多大程度上能预测人类在自然文本语料上的阅读时间行为。我们发现,跨越模型架构与训练数据集规模,词对数概率与阅读时间之间的关系是(近)线性的。我们接着评估这些模型的特征如何决定其心理测量预测能力,即预测人类阅读行为的能力。总体而言,模型的下一词期望越好,其心理测量预测能力越强。然而,我们发现不同模型架构间存在非平凡差异。在任一给定困惑度下,深度 Transformer 模型与 n-gram 模型通常比 LSTM 或结构监督神经模型展现出更优的心理测量预测能力,尤其对于眼动数据。最后,我们将模型的心理测量预测能力与其句法知识深度进行比较,后者由使用受控心理语言学实验方法开发的一系列句法泛化测试度量。在控制困惑度后,我们发现句法知识与预测能力之间无显著关系。这些结果表明,要最佳建模自然阅读中的人类实时语言理解行为 versus 为针对性探测句法知识而设计的受控语言材料中的行为,可能需要不同的方法。

关键词

引用

@article{arxiv.2006.01912,
  title  = {On the Predictive Power of Neural Language Models for Human Real-Time Comprehension Behavior},
  author = {Ethan Gotlieb Wilcox and Jon Gauthier and Jennifer Hu and Peng Qian and Roger Levy},
  journal= {arXiv preprint arXiv:2006.01912},
  year   = {2020}
}

备注

To Appear at CogSci 2020