中文

基于频率的上下文词嵌入中的失真现象

计算与语言 2021-04-20 v1

摘要

预训练数据中的词频如何影响上下文 BERT 嵌入中相似度度量的行为?是否存在某些词关系被夸大或弱化的系统性方式?在本工作中,我们利用两种新工具探究上下文词嵌入的几何特征:(1) 一个使用词嵌入预测词身份的恒等探针;(2) 词的上下文表示的极小包围球。我们的结果表明,高频词与低频词在其表示几何上存在显著差异。这种差异引入了失真:与人类判断相比,嵌入相似度的点估计(例如余弦相似度)会高估或低估两个词的语义相似度,取决于这些词在训练数据中的频率。这具有下游社会影响:BERT-Base 在区分南美与非洲国家时比区分北美与欧洲国家更困难。我们发现当使用 BERT-Multilingual 时这些失真持续存在,表明它们无法轻易通过额外数据修复,而这又引入了新的失真。

关键词

引用

@article{arxiv.2104.08465,
  title  = {Frequency-based Distortions in Contextualized Word Embeddings},
  author = {Kaitlyn Zhou and Kawin Ethayarajh and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2104.08465},
  year   = {2021}
}