中文

通过语法错误检测探查针对性句法知识

计算与语言 2022-10-31 v1

摘要

针对主谓一致(SVA)知识的定向研究表明,预训练语言模型编码了句法信息。我们断言,如果模型稳健地编码了主谓一致,它们应当能够识别一致正确与不一致的情况。为此,我们提出将语法错误检测作为一种诊断探针,以评估各层 token 级上下文表示对 SVA 知识的掌握。我们评估了来自五个预训练英语语言模型(BERT、XLNet、GPT-2、RoBERTa 和 ELECTRA)每一层的上下文表示。我们利用来自英语二语学习者和维基百科编辑的公开标注训练数据,并报告在人工构建的主谓一致刺激上的结果。我们发现掩码语言模型以线性方式编码了与 SVA 错误检测相关的信息,而自回归模型的表现与我们的基线相当。然而,我们也观察到当探针在不同训练集上训练、在不同句法结构上进行评估时性能出现分化,表明与 SVA 错误检测相关的信息并未被稳健地编码。

关键词

引用

@article{arxiv.2210.16228,
  title  = {Probing for targeted syntactic knowledge through grammatical error detection},
  author = {Christopher Davis and Christopher Bryant and Andrew Caines and Marek Rei and Paula Buttery},
  journal= {arXiv preprint arXiv:2210.16228},
  year   = {2022}
}

备注

CoNLL 2022