基于 Transformer 的语言模型惊奇度在约二十亿训练词符时最佳预测人类阅读时间
计算与语言
2023-10-24 v2
摘要
近期的心理语言学研究就语言模型质量与其惊奇度估计预测人类阅读时间的能力之间的关系得出了相互冲突的结论,这被推测是由于各研究在训练数据量与模型容量上均存在巨大差距。本研究旨在通过系统改变训练数据量与模型容量,评估基于 Transformer 的语言模型变体的惊奇度估计预测人类阅读时间的能力,以整合这些发现。结果表明,具有当代模型容量的多数变体在见到约二十亿训练词符后提供最佳拟合,此后开始偏离类人期望。此外,新训练的较小模型变体揭示了收敛时的“临界点”,此后语言模型困惑度的降低开始导致对人类阅读时间的拟合变差。这些结果表明,海量训练数据主要是较大预训练语言模型惊奇度拟合较差的成因,且一定程度的模型容量是基于 Transformer 的语言模型捕捉类人期望所必需的。
引用
@article{arxiv.2304.11389,
title = {Transformer-Based Language Model Surprisal Predicts Human Reading Times Best with About Two Billion Training Tokens},
author = {Byung-Doh Oh and William Schuler},
journal= {arXiv preprint arXiv:2304.11389},
year = {2023}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2023