是抽象而非记忆:BERT 与英语冠词系统
计算与语言
2022-06-10 v1
摘要
冠词预测是一项长期难以被精确语言描述刻画的任务。因此,该任务非常适合用于评估模型模拟母语者直觉的能力。为此,我们将母语英语使用者与预训练模型在冠词预测任务上的表现进行比较,该任务被设定为三选一(a/an、the、零冠词)。我们对 BERT 的实验表明,BERT 在所有冠词上均优于人类。特别是,BERT 在检测零冠词方面远胜于人类,可能是因为我们使用规则插入零冠词,而深度神经模型可轻易掌握这些规则。更有趣的是,我们发现当标注者间一致性高时,BERT 更倾向于与标注者而非语料库一致;而当标注者间一致性下降时,则转为更倾向于与语料库一致。我们认为,尽管 BERT 是在语料库上训练的,这种与标注者的一致性表明 BERT 并非在记忆冠词用法,而是捕捉到了类似于人类直觉的冠词用法的高层泛化。
引用
@article{arxiv.2206.04184,
title = {Abstraction not Memory: BERT and the English Article System},
author = {Harish Tayyar Madabushi and Dagmar Divjak and Petar Milin},
journal= {arXiv preprint arXiv:2206.04184},
year = {2022}
}
备注
Accepted for publication at 2022 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2022). Data and code available at https://github.com/H-TayyarMadabushi/Abstraction-not-Memory-BERT-and-the-English-Article-System-NAACL-2022