BERT 所不是的:来自一套语言模型心理语言学诊断工具的经验
计算与语言
2020-07-14 v2 人工智能
摘要
通过语言建模进行预训练已成为一种流行且成功的 NLP 任务方法,但我们尚未确切理解这些预训练过程赋予模型何种语言能力。本文引入一套取自人类语言实验的诊断工具,使我们能够针对语言模型在上下文中生成预测所利用的信息提出针对性问题。作为一个案例研究,我们将这些诊断应用于流行的 BERT 模型,发现它通常能区分涉及共享类别或角色反转的优劣补全,尽管其敏感度低于人类,并且它能稳健检索名词上位词,但在具有挑战性的推理与基于角色的事件预测上存在困难——尤其,它表现出对否定的上下文影响明显不敏感。
引用
@article{arxiv.1907.13528,
title = {What BERT is not: Lessons from a new suite of psycholinguistic diagnostics for language models},
author = {Allyson Ettinger},
journal= {arXiv preprint arXiv:1907.13528},
year = {2020}
}