中文

位置伪影在掩码语言模型嵌入中的传播

计算与语言 2021-05-26 v3

摘要

在本工作中,我们证明基于预训练掩码语言模型(masked language model)的编码器所导出的上下文词向量在各层间共享一种常见且可能不合意的特征模式。具体而言,我们在 BERT 与 RoBERTa 的隐藏状态向量中发现持续存在的离群神经元,其在所述向量中始终取最小或最大值。为探究该信息的来源,我们引入一种神经元级分析方法,揭示这些离群值与位置嵌入所捕获的信息密切相关。我们还从零预训练 RoBERTa-base 模型,发现不使用位置嵌入时离群值消失。我们发现,这些离群值是编码器原始向量空间各向异性的主要原因,而截断它们会提高向量间的相似度。我们通过实践表明,截断后的向量能更准确区分词义,且在均值池化时得到更好的句子嵌入。在三个有监督任务中,我们发现截断不影响性能。

关键词

引用

@article{arxiv.2011.04393,
  title  = {Positional Artefacts Propagate Through Masked Language Model Embeddings},
  author = {Ziyang Luo and Artur Kulmizev and Xiaoxi Mao},
  journal= {arXiv preprint arXiv:2011.04393},
  year   = {2021}
}

备注

Accepted as long paper at ACL 2021