RobustFair:通过公平性混淆导向梯度搜索的对抗评估
机器学习
2023-10-10 v2 人工智能
计算机与社会
摘要
深度神经网络(DNNs)常因其对各种对抗扰动的脆弱性而面临挑战,包括损害预测精度的虚假扰动,以及导致相似输入产生偏倚预测的偏倚扰动。本文提出一种新方法 RobustFair,用于在遭受这些虚假或偏倚扰动时评估 DNN 的准确公平性。RobustFair 利用准确公平性中诱导出的公平性混淆矩阵概念来识别用于扰动的关键输入特征。该矩阵将预测分类为真公平、真偏倚、假公平与假偏倚,由其引导的扰动可对实例及其相似对应项产生双重影响:要么损害预测精度(鲁棒性),要么导致偏倚预测(个体公平性)。RobustFair 随后基于由全导数近似的损失函数值推断这些生成的对抗实例的 ground truth。为利用所生成实例提升可信度,RobustFair 进一步提出一种数据增强策略,优先选择与原始训练集相似的对抗实例,用于数据增强与模型重训练。值得注意的是,RobustFair 擅长检测鲁棒性与个体公平性交织的问题,而这些在标准鲁棒性与个体公平性评估中常被忽视。该能力使 RobustFair 能通过同时识别任一领域的缺陷来加强鲁棒性与个体公平性评估。在基准数据集上的实证案例研究与分位数回归分析证明了公平性混淆矩阵引导的扰动在虚假或偏倚对抗实例生成中的有效性。
引用
@article{arxiv.2305.10906,
title = {RobustFair: Adversarial Evaluation through Fairness Confusion Directed Gradient Search},
author = {Xuran Li and Peng Wu and Kaixiang Dong and Zhen Zhang and Yanting Chen},
journal= {arXiv preprint arXiv:2305.10906},
year = {2023}
}