TESTSGD:针对神经网络隐含群体歧视的可解释测试方法
机器学习
2022-08-25 v1 计算机与社会
软件工程
摘要
许多机器学习应用中已被证实存在歧视现象,这要求在人脸识别、医疗诊断和刑事判决等伦理相关领域部署前对其进行充分的公平性测试。现有的公平性测试方法大多用于识别个体歧视,即针对个体的歧视。然而,作为另一种广受关注的歧视类型,针对群体歧视(多为隐藏的)的测试研究甚少。为弥补这一不足,本文提出 TESTSGD,一种可解释测试方法,可系统性地识别并度量神经网络在敏感特征组合条件所刻画的隐含(我们称之为“微妙”的)群体歧视。具体而言,给定一个神经网络,TESTSGD 首先自动生成一组可解释规则,将输入空间划分为暴露模型群体歧视的两个群体。同时,TESTSGD 还基于输入空间采样提供估计的群体公平性分数,以度量所识别出的微妙群体歧视程度,并保证在误差界内准确。我们在多个基于流行数据集(包括结构化数据和文本数据)训练的神经网络模型上评估 TESTSGD。实验结果表明,TESTSGD 能高效且有效地识别和度量此前从未被揭示的这种微妙群体歧视。此外,我们展示了 TESTSGD 的测试结果可指导新样本的生成,通过再训练缓解此类歧视且精度下降可忽略。
引用
@article{arxiv.2208.11321,
title = {TESTSGD: Interpretable Testing of Neural Networks Against Subtle Group Discrimination},
author = {Mengdi Zhang and Jun Sun and Jingyi Wang and Bing Sun},
journal= {arXiv preprint arXiv:2208.11321},
year = {2022}
}