控制偏差暴露以实现公平可解释预测
计算与语言
2022-10-25 v2
摘要
近期关于减少 NLP 模型偏差的工作通常聚焦于保护或隔离与敏感属性(如性别或种族)相关的信息。然而,当敏感信息在语义上与输入的任务信息纠缠时,例如性别信息对职业具有预测性,则难以在任务性能与偏差缓解之间实现公平权衡。现有方法通过从潜空间中消除偏差信息来进行此权衡,缺乏对所必须移除的偏差量的控制。我们认为,一种理想的去偏方法应当“公平地”使用敏感信息,而非盲目消除它(Caliskan 等, 2017; Sun 等, 2019; Bogen 等, 2020)。在本工作中,我们提供一种新颖的去偏算法,通过调整预测模型的信念来(1)若敏感信息对任务无用则忽略之;(2)在预测所必要时最小化地使用敏感信息(同时施加惩罚)。在受性别影响的两个文本分类任务和受种族影响的开放生成任务上的实验结果表明,我们的模型在去偏与任务性能之间实现了理想的权衡,并生成去偏依据作为证据。
引用
@article{arxiv.2210.07455,
title = {Controlling Bias Exposure for Fair Interpretable Predictions},
author = {Zexue He and Yu Wang and Julian McAuley and Bodhisattwa Prasad Majumder},
journal= {arXiv preprint arXiv:2210.07455},
year = {2022}
}
备注
Accepted to EMNLP-2022 Findings