深度神经网络公平性缺陷的信息论测试与调试
软件工程
2023-04-11 v1 机器学习
摘要
深度前馈神经网络(DNNs)正日益部署于社会经济关键决策支持软件系统中。DNNs 极擅长在其训练数据中发现极小且充分的统计模式。因此,DNNs 可能学会编码决策——放大已有偏见或引入新偏见——从而可能使受保护个体/群体处于不利地位,并可能违反法律保护。尽管现有的基于搜索的软件测试方法已能有效发现公平性缺陷,它们并未为这些缺陷提供调试辅助——如严重度与因果解释——而这些对于帮助开发者分流并决定后续行动至关重要。我们能否度量 DNNs 中公平性缺陷的严重度?这些缺陷是训练不当的表征,还是仅仅反映了训练数据中存在的偏见?为回答此类问题,我们提出 DICE:一个用于发现并定位 DNNs 中公平性缺陷的信息论测试与调试框架。DICE 的关键目标是通过按严重度排序来协助软件开发者分流公平性缺陷。为此,我们从决策中所用受保护信息(以比特计)的角度量化公平性。公平性缺陷的量化视图不仅有助于对这些缺陷排序,我们的实证评估表明,由于由此带来的搜索空间平滑性,它提升了搜索效率。在量化公平性的引导下,我们提出一种因果调试框架,以定位导致公平性缺陷的训练不足层与神经元。我们在十个为社会关键任务开发的 DNNs 上的实验表明,DICE 能高效刻画歧视量、有效生成歧视性实例,并定位具有显著偏见的层/神经元。
引用
@article{arxiv.2304.04199,
title = {Information-Theoretic Testing and Debugging of Fairness Defects in Deep Neural Networks},
author = {Verya Monjezi and Ashutosh Trivedi and Gang Tan and Saeid Tizpaz-Niari},
journal= {arXiv preprint arXiv:2304.04199},
year = {2023}
}
备注
2023 IEEE/ACM 45th International Conference on Software Engineering (ICSE 2023)