余弦作为高频词嵌入相似度度量的问题
计算与语言
2022-05-12 v1 人工智能
摘要
上下文嵌入的余弦相似度被用于许多 NLP 任务(例如 QA、IR、MT)和度量(例如 BERTScore)中。在此,我们揭示了通过 BERT 嵌入上的余弦估计词相似度被低估的系统性方式,并将此效应追溯至训练数据频率。我们发现,相对于人类判断,余弦相似度低估了高频词与自身其他实例或其他词在不同上下文中的相似性,即使在控制了多义性及其他因素之后也是如此。我们推测,高频词相似度的这种低估是由于高频与低频词在表示几何上的差异所致,并针对二维情形给出了形式化论证。
引用
@article{arxiv.2205.05092,
title = {Problems with Cosine as a Measure of Embedding Similarity for High Frequency Words},
author = {Kaitlyn Zhou and Kawin Ethayarajh and Dallas Card and Dan Jurafsky},
journal= {arXiv preprint arXiv:2205.05092},
year = {2022}
}
备注
Camera Ready for ACL 2022 (Main Conference)