SAME 分数:一种改进的基于余弦的词嵌入偏置分数
计算与语言
2024-09-13 v3
摘要
随着大语言模型(LLM)的极大流行,许多研究者对这类模型中嵌入的社会偏见提出了伦理担忧。已有若干测量社会偏见的方法被提出,但显然这些方法在偏见之存在或严重程度上未必一致。此外,一些工作已揭示某些偏置度量存在理论问题或严重局限。为此,我们引入 SAME,一种用于嵌入中语义偏见的新型偏置分数。我们进行了详尽的理论分析并开展实验,以展示其相对于文献中类似偏置分数的优势。我们进一步凸显了由 SAME 度量的语义偏见与下游偏见之间的实质关联,而近来有论点认为此关联可忽略。相反,我们表明 SAME 能够度量语义偏见,并辨识出下游任务中社会偏见的潜在成因。
引用
@article{arxiv.2203.14603,
title = {The SAME score: Improved cosine based bias score for word embeddings},
author = {Sarah Schröder and Alexander Schulz and Barbara Hammer},
journal= {arXiv preprint arXiv:2203.14603},
year = {2024}
}
备注
12 pages, 3 figures