中文

基于SCM的交叉性偏见缓解后词嵌入质量与连贯性评估

人工智能 2026-01-09 v1

摘要

静态词嵌入常会吸收其学习自文本中的社会偏见,这些偏见可能默默影响下游系统。以往使用性别刻度模型 (Stereotype Content Model, SCM) 的工作大多关注单一群体偏见,侧重于温暖与能力两个维度。我们扩展了这一视角,针对交叉性偏见构建社会身份对的复合表示(通过求和或拼接),并应用三种去偏方法:减法、线性投影和部分投影。我们研究了三类广泛使用的嵌入模型(Word2Vec、GloVe和ConceptNet Numberbatch),并采用两种互补的实用性视角进行评估:局部邻域是否保持连贯性以及类比行为是否被保留。在所有模型中,SCM-based的缓解对交叉性情况的应用效果良好,基本保持了整体语义景观的完整性。主要代价是熟悉的权衡:那些最严格保持几何结构的方法在类比行为方面较为谨慎,而更积极的投影则可改善类比效果,但以牺牲严格的邻域稳定性为代价。部分投影始终如一地保守,保持表示稳定;线性投影更为果断;减法是一种简单基线,仍具竞争力。求和与拼接的选择取决于嵌入模型族及应用目标。总体而言,这些发现表明SCM的交叉性去偏在静态嵌入中是可行的,并为在稳定性与类比性能之间进行权衡时选择聚合和去偏设置提供了指导。

关键词

引用

@article{arxiv.2601.04393,
  title  = {Assessing the quality and coherence of word embeddings after SCM-based intersectional bias mitigation},
  author = {Eren Kocadag and Seyed Sahand Mohammadi Ziabari and Ali Mohammed Mansoor Alsahag},
  journal= {arXiv preprint arXiv:2601.04393},
  year   = {2026}
}