中文

BERT 如何感到意外?语言异常的分层检测

计算与语言 2021-05-18 v1

摘要

Transformer 语言模型在检测上下文中词语异常方面表现出显著能力,但似然分数无法提供关于异常原因的信息。本文中,我们对三个语言模型(BERT、RoBERTa 和 XLNet)的中间层使用高斯模型进行密度估计,并在语法判断基准 BLiMP 上评估我们的方法。在较低层,意外度与低词频高度相关,但这种相关性在较高层中减弱。接下来,我们从心理语言学研究中收集形态句法、语义和常识异常的数据集;我们发现表现最好的模型 RoBERTa 在异常为形态句法时比异常为语义时在更早的层表现出意外度,而常识异常在任何中间层均未表现出意外度。这些结果表明语言模型采用不同机制来检测不同类型的语言异常。

关键词

引用

@article{arxiv.2105.07452,
  title  = {How is BERT surprised? Layerwise detection of linguistic anomalies},
  author = {Bai Li and Zining Zhu and Guillaume Thomas and Yang Xu and Frank Rudzicz},
  journal= {arXiv preprint arXiv:2105.07452},
  year   = {2021}
}

备注

ACL 2021 (Long Paper)