心理语言学中分词的正确处理方式
计算与语言
2024-12-09 v3
摘要
语言模型在计算心理语言学研究中广泛用于测试与负对数概率(surprisal)相关的理论,该概率衡量感兴趣区域(字符子串)下的模型条件概率,与读者经验的认知成本相关,如读者对该区域的注视时长。然而,现代语言模型的应用在心理语言学研究中受到分词实践的复杂性制约,即将其用作训练模型的中间步骤。结果是,语言模型作用于标记字符串而非字符字符串。令人苦恼的是,感兴趣的区域通常与这些标记字符串错位。本文论证应在心理语言学研究中使用语言模型计算感兴趣区域的 surprisal 之前,将标记级别的语言模型(约等于)边缘化为字符级别的语言模型;然后,可用于计算任意字符子串的 surprisal,我们将其称为焦点区域,该区域实验者可能希望用作预测器。我们提出的将标记级模型边缘化为字符级模型的方案独立于分词方案,解决了这种错位问题。实验上,我们发现各种焦点区域的 surprisal 比感兴趣区域本身的 surprisal 更好的心理测量预测器。
引用
@article{arxiv.2410.02691,
title = {On the Proper Treatment of Tokenization in Psycholinguistics},
author = {Mario Giulianelli and Luca Malagutti and Juan Luis Gastaldi and Brian DuSell and Tim Vieira and Ryan Cotterell},
journal= {arXiv preprint arXiv:2410.02691},
year = {2024}
}
备注
Main conference long paper at EMNLP 2024. New version: copy-editing and updated bib