中文

语言编码器面对语法错误时的鲁棒性研究

计算与语言 2020-05-13 v1

摘要

我们进行了全面的研究,以诊断预训练语言编码器(ELMo、BERT 和 RoBERTa)在面对自然语法错误时的行为。具体而言,我们从非母语者中收集真实的语法错误,并进行对抗攻击以在干净文本数据上模拟这些错误。我们使用这种方法来促进在下游应用中调试模型。结果证实,所有被测试模型的性能均受到影响,但影响程度各异。为了解释模型行为,我们进一步设计了一个语言可接受性任务,以揭示它们识别不合语法句子及错误位置的能力。我们发现,在句子正确性预测上训练的带有简单分类器的固定上下文编码器能够定位错误位置。我们还为 BERT 设计了完形填空测试,发现 BERT 能够捕捉上下文中错误与特定 token 之间的交互。我们的结果为理解语言编码器面对语法错误时的鲁棒性和行为提供了启示。

关键词

引用

@article{arxiv.2005.05683,
  title  = {On the Robustness of Language Encoders against Grammatical Errors},
  author = {Fan Yin and Quanyu Long and Tao Meng and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2005.05683},
  year   = {2020}
}

备注

ACL 2020