中文

用于深度神经网络公平性测试的对抗采样

机器学习 2023-03-07 v1 计算机与社会

摘要

在本研究中,我们关注使用对抗采样来测试给定数据集中不同类别图像在深度神经网络模型预测中的公平性。尽管已有若干框架被提出以确保机器学习模型对抗对抗攻击的鲁棒性,其中一些包括对抗训练算法,但仍存在对抗训练算法往往导致不同群体间准确率和鲁棒性差异的缺陷。我们的研究旨在使用对抗采样来测试给定数据集中不同类别或范畴图像在深度神经网络模型预测中的公平性。我们成功展示了一种在深度神经网络分类器中保障各输入群体间公平性的新方法。我们在原始图像上训练神经网络模型,且未在扰动或受攻击图像上训练模型。当我们将对抗采样输入模型时,模型能够预测该对抗样本所属图像的原始类别。我们还引入并使用了软件工程中的关注点分离概念,即增设一个独立的过滤层,在将扰动图像自动传入网络分类前大量去除其中的噪声或攻击,由此我们达到了 93.3% 的准确率。Cifar-10 数据集有十个数据类别,因此,为考量公平性,我们将假设应用于每个数据类别并得到了连贯的结果与准确率。

关键词

引用

@article{arxiv.2303.02874,
  title  = {Adversarial Sampling for Fairness Testing in Deep Neural Network},
  author = {Tosin Ige and William Marfo and Justin Tonkinson and Sikiru Adewale and Bolanle Hafiz Matti},
  journal= {arXiv preprint arXiv:2303.02874},
  year   = {2023}
}

备注

7 pages, 5 figures, International Journal of Advanced Computer Science and Application