为何更大规模 Transformer 语言模型的惊奇度对人类阅读时间拟合更差?
计算与语言
2022-12-26 v1
摘要
本文对为何参数更多、困惑度更低、基于 Transformer 的更大预训练语言模型所产生的惊奇度估计对人类阅读时间的预测性更弱,给出了细致的语言学分析。首先,回归分析在两个独立数据集上展示了最近发布的五个 GPT-Neo 变体与八个 OPT 变体的困惑度与阅读时间拟合之间严格的单调正对数线性关系,复现了此前仅限于 GPT-2 的结果(Oh 等,2022)。随后,残差误差分析揭示了较大变体的系统性偏差,例如对命名实体的阅读时间欠预测,并对情态动词与连词等功能词的阅读时间作出补偿性过预测。这些结果表明,较大的基于 Transformer 的模型在训练时‘记忆’序列的倾向使其惊奇度估计偏离类人期望,这警示我们在使用预训练语言模型研究人类语言处理时需谨慎。
引用
@article{arxiv.2212.12131,
title = {Why Does Surprisal From Larger Transformer-Based Language Models Provide a Poorer Fit to Human Reading Times?},
author = {Byung-Doh Oh and William Schuler},
journal= {arXiv preprint arXiv:2212.12131},
year = {2022}
}
备注
Transactions of the Association for Computational Linguistics (pre-MIT Press publication version)