基于余弦相似度的词嵌入偏差分数的语义属性
计算与语言
2024-09-13 v2
摘要
大量研究已引起人们对语言模型中社会偏差的关注,并提出了检测此类偏差的方法。因此,文献中包含了大量不同的偏差测试和分数,每种方法都旨在揭示其他分数未能检测到的更多偏差。然而,文献中严重缺乏的是分析这些偏差分数并帮助研究人员理解现有方法优势或局限性的比较研究。在这项工作中,我们旨在填补基于余弦相似度的偏差分数在这方面的空白。通过建立偏差的几何定义,我们提出了偏差分数在量化偏差时被认为有意义的要求。此外,我们根据这些要求正式分析了文献中基于余弦相似度的分数。我们通过实验来强调这些发现,以表明偏差分数的局限性在实际应用案例中会产生影响。
引用
@article{arxiv.2401.15499,
title = {Semantic Properties of cosine based bias scores for word embeddings},
author = {Sarah Schröder and Alexander Schulz and Fabian Hinder and Barbara Hammer},
journal= {arXiv preprint arXiv:2401.15499},
year = {2024}
}
备注
11 pages, 3 figures. arXiv admin note: text overlap with arXiv:2111.07864