中文

通过 L2 范数折扣解决高频词间余弦相似度低估问题

计算与语言 2023-05-19 v1

摘要

使用从 BERT 等掩码语言模型(MLMs)获得的上下文化词嵌入计算的两个词之间的余弦相似度,已被证明会低估这些词之间的实际相似度(Zhou et al., 2022)。这种相似度低估问题对于高频词尤为严重。尽管先前工作已注意到该问题,但迄今未提出解决方案。我们观察到,一个词的上下文化嵌入的 L2 范数与其在预训练语料中的对数频率相关。因此,高频词所关联的更大 L2 范数降低了它们之间测得的余弦相似度值,从而低估了相似度分数。为解决此问题,我们提出在度量词间余弦相似度时,根据该词在语料中的频率对其上下文化词嵌入的 L2 范数进行折扣。我们表明,所谓的停用词与其余词表现不同,在折扣过程中需要特殊处理。在上下文化词相似度数据集上的实验结果表明,我们提出的折扣方法准确解决了相似度低估问题。

关键词

引用

@article{arxiv.2305.10610,
  title  = {Solving Cosine Similarity Underestimation between High Frequency Words by L2 Norm Discounting},
  author = {Saeth Wannasuphoprasit and Yi Zhou and Danushka Bollegala},
  journal= {arXiv preprint arXiv:2305.10610},
  year   = {2023}
}

备注

7 pages, 5 figures. To be published in the Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics, 9-14 July 2023, Toronto, Canada