人们浏览的概率性预测:评估语言模型性能用于心理语言学建模的指标
计算与语言
2021-06-25 v1 神经与进化计算
摘要
通过假定自然阅读时间与信息论惊奇度之间的关系,惊奇度理论(Hale, 2001; Levy, 2008)为语言模型与心理语言学模型提供了自然接口。本文重新评估了 Goodkind 与 Bicknell(2018)提出的主张,即语言模型对阅读时间的建模能力是其困惑度的线性函数。通过将 Goodkind 与 Bicknell 的分析扩展到现代神经架构,我们表明所提关系对长短期记忆网络、Transformers 与预训练模型并非总是成立。我们引入了一种基于从人类受试者测得 Cloze 概率的称为可预测性规范相关性的语言建模性能替代度量。我们的新指标产生了语言模型质量与心理语言学建模性能之间更稳健的关系,允许比较具有不同训练配置的模型。
引用
@article{arxiv.2009.03954,
title = {Probabilistic Predictions of People Perusing: Evaluating Metrics of Language Model Performance for Psycholinguistic Modeling},
author = {Yiding Hao and Simon Mendelsohn and Rachel Sterneck and Randi Martinez and Robert Frank},
journal= {arXiv preprint arXiv:2009.03954},
year = {2021}
}
备注
To appear in the proceedings of the Cognitive Modeling and Computational Linguistics workshop (CMCL) at EMNLP 2020