神经语言模型与人类增量处理的针对性评估
计算与语言
2023-10-26 v2
摘要
我们通过对十六种不同句法测试套件在一系列结构现象上逐词收集反应时间数据,对人类的增量处理与神经语言模型进行了针对性的、规模化的比较。人类反应时间数据来自一种称为插值迷宫任务(Interpolated Maze task)的新型在线实验范式。我们将人类反应时间与四种当代语言模型(具有不同架构并训练于不同规模数据集)的逐词概率进行比较。我们发现,在许多现象中,人类和语言模型在不合语法句子区域均表现出处理难度增加,且人类与模型的“准确率”分数(类似 Marvin 和 Linzen(2018))大致相当。然而,尽管语言模型输出在方向上与人类一致,我们表明模型系统性地低估了合语法与不合语法句子之间增量处理难度差异的幅度。具体而言,当模型遇到句法违例时,它们无法准确预测人类数据中观测到的更长反应时间。这些结果对当代语言模型是否正在接近人类对句法违例敏感性的类人表现提出了质疑。
引用
@article{arxiv.2106.03232,
title = {A Targeted Assessment of Incremental Processing in Neural LanguageModels and Humans},
author = {Ethan Gotlieb Wilcox and Pranali Vani and Roger P. Levy},
journal= {arXiv preprint arXiv:2106.03232},
year = {2023}
}
备注
Published in the proceedings of ACL 2021