内在偏置度量与应用偏置不相关
计算与语言
2021-06-09 v5
摘要
自然语言处理(NLP)系统习得了有害的社会偏见,导致其在越来越多场景部署时放大不平等。为引导去偏工作,NLP 社区依赖多种量化模型偏置的度量。其中一些是内在的,衡量词嵌入空间中的偏置;一些是外在的,衡量词嵌入所赋能的下游任务中的偏置。这些内在与外在度量彼此相关吗?我们在涵盖不同任务与实验条件的数百个训练模型中比较了内在与外在度量。我们的结果表明,在所有跨任务与语言的情景中,这些度量之间不存在可靠的相关关系。我们敦促从事去偏的研究者关注偏置的外在度量,并通过创建新的挑战集与标注测试数据使使用这些度量更为可行。为助此力,我们发布了代码、一种新的内在度量,以及聚焦于仇恨言论中性别偏置的标注测试集。
引用
@article{arxiv.2012.15859,
title = {Intrinsic Bias Metrics Do Not Correlate with Application Bias},
author = {Seraphina Goldfarb-Tarrant and Rebecca Marchant and Ricardo Muñoz Sanchez and Mugdha Pandya and Adam Lopez},
journal= {arXiv preprint arXiv:2012.15859},
year = {2021}
}
备注
In Proceedings of ACL 2021, 9 pages