泛化技术对图像分类中隐私、效用与公平性之间相互影响的作用
机器学习
2024-12-17 v1 人工智能
摘要
本研究使用机器学习(ML)调查了图像分类中公平性、隐私性和效用性之间的权衡。最近的研究表明,泛化技术可以改善隐私和效用之间的平衡。本工作的一个重点是锐度感知训练(SAT)及其与差分隐私的结合(DP-SAT),以进一步改善这种平衡。此外,我们在包含合成偏差和真实世界偏差的数据集上,检查了私有和非私有学习模型的公平性。我们还通过执行成员推理攻击来衡量这些场景中涉及的隐私风险,并探讨了消除高隐私风险样本(称为离群点)的后果。此外,我们引入了一个名为 \emph{harmonic score} 的新指标,它将准确性、隐私性和公平性结合为一个单一度量。通过使用泛化技术的实证分析,我们在 CIFAR-10 上实现了在 -DP 下 81.11\% 的准确率,超越了 De 等人(2022)报告的 79.5\%。此外,我们的实验表明,训练样本的记忆化可能在过拟合点之前就开始了,而泛化技术并不能保证阻止这种记忆化。我们对合成偏差的分析表明,泛化技术会在私有和非私有模型中放大模型偏差。此外,我们的结果表明,训练数据中偏差的增加会导致准确率下降、更容易受到隐私攻击以及更高的模型偏差。我们使用 CelebA 数据集验证了这些发现,表明类似的趋势在真实世界的属性不平衡中依然存在。最后,我们的实验表明,移除离群点数据会降低准确率并进一步放大模型偏差。
引用
@article{arxiv.2412.11951,
title = {The Impact of Generalization Techniques on the Interplay Among Privacy, Utility, and Fairness in Image Classification},
author = {Ahmad Hassanpour and Amir Zarei and Khawla Mallat and Anderson Santana de Oliveira and Bian Yang},
journal= {arXiv preprint arXiv:2412.11951},
year = {2024}
}
备注
Published as a conference paper at the 25th Privacy Enhancing Technologies Symposium (PETS 2025)