中文

基于字符的惊奇度作为存在错误时阅读困难的模型

计算与语言 2019-05-21 v3

摘要

直观上,人类读者能轻松应对文本中的错误;错别字、拼写错误、词语替换等不会过度干扰自然阅读。先前的研究表明字母转位会导致阅读时间增加,但尚不清楚这种效应是否能推广到更自然的错误。在本文中,我们报告了一项眼动追踪研究,比较了两种错误类型(字母转位和自然发生的拼写错误)和两种错误率(10%或50%的所有单词包含错误)。我们发现尽管存在这些错误,人类读者表现出不受损的理解能力,但错误词比正确词引起更多的阅读困难。此外,转位比拼写错误更困难,且高错误率增加了所有单词的困难,包括正确单词。然后我们提出了一个使用基于字符(而非传统的基于单词)的惊奇度来解释这些结果的计算模型。该模型解释转位比拼写错误更困难是因为它们包含意外的字母组合。它还解释了错误率效应:当上下文退化时, upcoming单词更难预测,导致惊奇度增加。

关键词

引用

@article{arxiv.1902.00595,
  title  = {Character-based Surprisal as a Model of Reading Difficulty in the Presence of Error},
  author = {Michael Hahn and Frank Keller and Yonatan Bisk and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:1902.00595},
  year   = {2019}
}

备注

Published in Proceedings of CogSci 2019