基于充分性度量的深度图像分类公平性测试
机器学习
2021-12-03 v2
摘要
随着深度图像分类应用(例如人脸识别)在日常生活中日益普及,其公平性问题引发了越来越多的关注。因此,在部署前对这些应用进行全面的公平性测试至关重要。现有的公平性测试方法存在以下局限:1)适用性,即它们仅适用于结构化数据或文本,未处理图像分类应用在语义层面的高维抽象域采样;2)功能性,即它们生成不公平样本却未提供表征模型公平性充分性的测试准则。为弥补这一不足,我们提出 DeepFAIT,一种专为深度图像分类应用设计的系统性公平性测试框架。DeepFAIT 包含若干重要组件以实现有效的公平性测试:1)用于识别公平性相关神经元的神经元选择策略;2)一组多粒度充分性度量以评估模型的公平性;3)用于高效修复公平性问题的测试选择算法。我们在广泛采用的大规模人脸识别应用(即 VGGFace 和 FairFace)上进行了实验。实验结果证实,我们的方法能有效识别公平性相关神经元、刻画模型公平性,并筛选最有价值的测试用例以缓解模型的公平性问题。
引用
@article{arxiv.2111.08856,
title = {Fairness Testing of Deep Image Classification with Adequacy Metrics},
author = {Peixin Zhang and Jingyi Wang and Jun Sun and Xinyu Wang},
journal= {arXiv preprint arXiv:2111.08856},
year = {2021}
}