中文

用串行复现评估鲁棒词识别模型

计算与语言 2021-01-26 v1

摘要

口语交际发生在“噪声信道”中,其特征是高水平的环境噪声、说话人内部与说话人之间的变异性,以及词汇和句法歧义。鉴于所接收语言输入的这些特性,鲁棒的口语词识别——以及更广义的语言处理——严重依赖听者的先验知识来评估该输入的候选解释更可能或更不可能。在此,我们比较了几种广覆盖概率生成语言模型捕捉人类语言期望的能力。串行复现是一种实验范式,其中口语话语由连续参与者复现,类似于儿童的“传话”游戏,用于引出反映英语成人语言期望的样本。当我们针对所产生的语句链评估一组概率生成语言模型时,我们发现那些利用前述语言上下文(即短语结构)的抽象表示的模型最好地预测了人们在串行复现过程中所作的改变。一个预测话语中哪些词在口语传递过程中最有可能丢失或改变的逻辑回归模型证实了这一结果。我们结合强调基于记忆的约束与表征在语言处理中相互作用的研究来阐释这些发现。

关键词

引用

@article{arxiv.2101.09788,
  title  = {Evaluating Models of Robust Word Recognition with Serial Reproduction},
  author = {Stephan C. Meylan and Sathvik Nair and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2101.09788},
  year   = {2021}
}