语言模型子词词汇中的前导空格对计算单词概率构成混淆
计算与语言
2024-10-01 v2
摘要
基于Transformer的语言模型对逐词条件概率的预测常被用于评估人类读者的增量处理难度。在本文中,我们认为,将这些语言模型的子词概率聚合为单词概率的最常见方法存在一个混淆因素。这是因为大多数语言模型的子词词汇中的词元具有前导空格,因此不能自然地定义单词的停止概率。我们首先证明,这可能导致单词概率分布之和大于1,从而违反了的公理。这一性质导致逐词惊奇度的错误分配,使得当前词末尾的不可接受性被错误地传递到下一个词。此外,这种对词边界的隐式预测错误地模拟了心理语言学实验,其中人类受试者直接观察到即将出现的词边界。我们提出了一种简单的解码技术,将尾部空格的概率重新计入当前词的概率中,从而解决了这一混淆。实验表明,这种校正揭示了及物/不及物句子中花园路径效应的较低估计值,并对自然阅读时间的拟合效果较差。
引用
@article{arxiv.2406.10851,
title = {Leading Whitespaces of Language Models' Subword Vocabulary Pose a Confound for Calculating Word Probabilities},
author = {Byung-Doh Oh and William Schuler},
journal= {arXiv preprint arXiv:2406.10851},
year = {2024}
}
备注
EMNLP 2024