分布词向量空间中显式与隐式去偏的通用框架
计算与语言
2020-01-06 v2 人工智能
摘要
分布词向量近来被证明编码了许多人类偏见,最显著的是性别与种族偏见,因此已提出削弱此类偏见的模型。然而,现有模型与研究(1)基于未明确且彼此相异的偏见定义,(2)针对特定偏见(如性别偏见)定制,(3)评估不一致且不严谨。本工作中,我们引入一个用于词嵌入去偏的通用框架。我们通过区分两类偏见规范——显式与隐式——来操作化偏见定义。随后提出三种作用于显式或隐式偏见规范并可组合以实现更鲁棒去偏的模型。最后,我们设计了一个完整的评估框架,将现有偏见度量与新提出的度量相结合。在三种嵌入方法上的实验结果表明,所提出的去偏模型鲁棒且广泛适用:它们常能在不损害任一输入分布空间中编码的语义信息的前提下,完全消除隐式与显式偏见。此外,我们通过跨语言嵌入空间成功迁移去偏模型,并在缺乏现成偏见规范的语言的分布词向量空间中去除或削弱偏见。
引用
@article{arxiv.1909.06092,
title = {A General Framework for Implicit and Explicit Debiasing of Distributional Word Vector Spaces},
author = {Anne Lauscher and Goran Glavaš and Simone Paolo Ponzetto and Ivan Vulić},
journal= {arXiv preprint arXiv:1909.06092},
year = {2020}
}
备注
AAAI 2020