中文

迷失于上下文?论上下文词嵌入在词义层面的方差

计算与语言 2022-08-23 v1

摘要

语言模型中的上下文词嵌入为自然语言处理(NLP)带来了诸多进展。直观上,句子信息被整合进词的表示中,这有助于建模一词多义。然而,上下文敏感性也导致了表示的方差,这可能破坏同义词之间的语义一致性。我们量化了在典型预训练模型中每个词义的上下文词嵌入在不同上下文中的变化程度。结果表明,上下文词嵌入在不同上下文中可以高度一致。此外,词性、词义数量以及句子长度对词义表示的方差有影响。有趣的是,我们发现词表示存在位置偏置,不同上下文中的首个词往往更为相似。我们分析了这一现象,并提出了一种简单方法来缓解基于距离的词义消歧设定中的此类偏置。

关键词

引用

@article{arxiv.2208.09669,
  title  = {Lost in Context? On the Sense-wise Variance of Contextualized Word Embeddings},
  author = {Yile Wang and Yue Zhang},
  journal= {arXiv preprint arXiv:2208.09669},
  year   = {2022}
}