数据增强如何影响机器学习中的隐私?
机器学习
2021-03-01 v3 机器学习
摘要
文献中观察到数据增强可显著缓解成员推断 (MI) 攻击。然而,在本文中,我们通过提出利用增强数据信息的新 MI 攻击来质疑这一观察。MI 攻击被广泛用于衡量模型对训练集的信息泄露。我们建立了模型以增强数据训练时的最优成员推断,这启发我们将 MI 攻击表述为一个集合分类问题,即分类一组增强实例而非单个数据点,并设计输入排列不变特征。经验上,我们证明当模型以数据增强训练时,所提方法普遍优于原始方法。更进一步,我们表明所提方法在一些数据增强训练的模型上可达到比现有方法在无数据增强训练的模型上更高的 MI 攻击成功率。值得注意的是,我们在 CIFAR10 上对宽残差网络实现了 70.1% 的 MI 攻击成功率,而先前最佳方法仅达 61.9%。这表明以数据增强训练的模型的隐私风险可能被严重低估。
引用
@article{arxiv.2007.10567,
title = {How Does Data Augmentation Affect Privacy in Machine Learning?},
author = {Da Yu and Huishuai Zhang and Wei Chen and Jian Yin and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2007.10567},
year = {2021}
}
备注
AAAI Conference on Artificial Intelligence (AAAI-21). Source code available at: https://github.com/dayu11/MI_with_DA