频率解释了大型语言模型的规模、训练数据量与惊异度对阅读时间拟合度的反相关
计算与语言
2024-02-06 v1 机器学习
摘要
近期研究表明,随着基于 Transformer 的语言模型规模增大并在海量数据上训练,其惊异度估计对自然人类阅读时间的拟合度会下降。本文提出了一系列分析,表明词频是这两个趋势背后的关键解释因素。首先,四个语言模型家族在四个语料库上的残差误差表明,模型规模与阅读时间拟合度之间的反相关性在最罕见词子集上最强,这是由较大模型变体对罕见词的过度准确预测所驱动的。此外,训练动态表明,在训练后期,所有模型变体都学会预测罕见词,且较大模型变体预测得更准确,这解释了训练数据量和模型规模对阅读时间拟合度的不利影响。最后,特征归因分析表明,与较小模型变体相比,较大模型变体能够基于更长的有效上下文窗口大小以及更强的局部关联来准确预测罕见词。综上所述,这些结果表明,基于 Transformer 的语言模型的惊异度估计偏离了类人预期,原因在于它们为预测罕见词而学习了超人类水平的复杂关联。
引用
@article{arxiv.2402.02255,
title = {Frequency Explains the Inverse Correlation of Large Language Models' Size, Training Data Amount, and Surprisal's Fit to Reading Times},
author = {Byung-Doh Oh and Shisen Yue and William Schuler},
journal= {arXiv preprint arXiv:2402.02255},
year = {2024}
}
备注
EACL 2024