SABAF:通过对抗式滤波去除神经网络中的强属性偏置
机器学习
2023-11-17 v2 计算机与社会
摘要
确保神经网络不依赖受保护属性(如种族、性别、年龄)进行预测,对推进公平可信的 AI 至关重要。尽管已有若干去除神经网络属性偏置的有前景方法,其局限性仍未被充分探索。为此,本文从数学与经验上揭示现有属性偏置去除方法在强偏置下的局限,并提出可缓解该局限的新方法。具体地,我们首先推导出任意属性偏置去除方法性能关于偏置强度的一般非空信息论上界,揭示其仅在数据集固有偏置相对较弱时有效。接着,我们推导出无论偏置强度如何均能去除属性偏置的任意方法存在的必要条件。受该条件启发,我们提出一种新方法,利用对抗目标直接在输入空间中过滤掉受保护属性,同时最大程度保留其他所有属性,且无需任何特定目标标签。所提方法在强偏置与中等偏置设定下均达到 SOTA 性能。我们在合成、图像与人口普查数据集上开展充分实验,以验证所推导理论界及其实际后果,并评估所提方法去除强属性偏置的有效性。
引用
@article{arxiv.2311.07141,
title = {SABAF: Removing Strong Attribute Bias from Neural Networks with Adversarial Filtering},
author = {Jiazhi Li and Mahyar Khayatkhoei and Jiageng Zhu and Hanchen Xie and Mohamed E. Hussein and Wael AbdAlmageed},
journal= {arXiv preprint arXiv:2311.07141},
year = {2023}
}
备注
35 pages, 18 figures, 32 tables. This work is an extended version of our paper (arXiv:2310.04955). Code will be released at https://github.com/jiazhi412/strong_attribute_bias