在去偏语言表示模型时勿伤害受保护群体
计算与语言
2023-11-14 v2 计算机与社会
摘要
用真实世界数据训练的语言表示模型(LRM)可能捕获并加剧不良偏见,并在各种人口统计群体中对人造成不公平对待。已有若干技术被研究用于将干预应用于 LRM 以去除基准评测(例如词嵌入)中的偏见。然而,去偏干预的负面副作用通常在下游任务中未被揭示。我们提出 xGAP-DEBIAS,一套用于评估去偏公平性的评测。在这项工作中,我们在一个真实世界文本分类任务上考察了四种去偏技术,并表明减少偏见是以所有人口统计群体(包括那些去偏技术旨在保护的群体)性能退化为代价的。我们主张,去偏技术应具有良好的下游性能,并以确保不对受保护群体造成伤害为约束。
引用
@article{arxiv.2310.18458,
title = {Do Not Harm Protected Groups in Debiasing Language Representation Models},
author = {Chloe Qinyu Zhu and Rickard Stureborg and Brandon Fain},
journal= {arXiv preprint arXiv:2310.18458},
year = {2023}
}