中文

在11种语言中检验惊奇理论(Surprisal Theory)的预测

计算与语言 2025-04-15 v4

摘要

心理语言学中的一个基本结论是,可预测性较低的词需要更长的处理时间。对此发现的一种理论解释是惊奇理论(Surprisal Theory)(Hale, 2001; Levy, 2008),该理论将一个词的可预测性量化为其惊奇度(surprisal),即给定上下文下的负对数概率。尽管支持惊奇理论预测的证据已被广泛复现,但大多数研究都集中于极窄的数据范围:以英语为母语者阅读英语文本。事实上,尚不存在全面的多语言分析。我们通过考察十一种不同语言(分布于五个语系)中惊奇度与阅读时间的关系,弥补了当前文献中的这一空白。基于在单语与多语语料上训练的语言模型得出估计值,我们检验了与惊奇理论相关的三个预测:(i)惊奇度是否能预测阅读时间;(ii)期望惊奇度(即上下文熵)是否能预测阅读时间;(iii)惊奇度与阅读时间之间的联结函数是否为线性。我们发现这三个预测在跨语言上都成立。通过聚焦于更多样化的语言集合,我们认为这些结果提供了迄今为止信息理论与跨语言增量语言处理之间最稳健的联系。

关键词

引用

@article{arxiv.2307.03667,
  title  = {Testing the Predictions of Surprisal Theory in 11 Languages},
  author = {Ethan Gotlieb Wilcox and Tiago Pimentel and Clara Meister and Ryan Cotterell and Roger P. Levy},
  journal= {arXiv preprint arXiv:2307.03667},
  year   = {2025}
}

备注

This is a revised version of the paper: The original version of the paper used raw frequencies instead of unigram surprisals in our regression models, despite stating otherwise in the text. This has been amended, and several typos have been fixed