中文

针对表格数据GAN的隐私重识别攻击

密码学与安全 2024-04-02 v1 机器学习

摘要

生成模型容易过拟合,因此可能会泄露训练数据中的敏感信息。在本研究中,我们调查了使用生成对抗网络(GAN)创建表格合成数据集可能带来的隐私风险。为此,我们分析了重识别攻击对合成数据的影响,即基于与最近合成记录的邻近度,选择预测对应于已记忆训练样本的样本进行攻击。因此,我们考虑了多种场景,在这些场景中不同的攻击者可能对生成模型和预测模型具有不同的访问权限或了解程度,并评估了哪些信息对于发起更成功的重识别攻击可能最有用。在此过程中,我们还考虑了将重识别攻击表述为重构攻击的情形,即攻击者使用进化多目标优化将合成样本向训练空间扰动的情形。结果表明,攻击者确实可以通过选择可能代表已记忆训练样本的合成样本造成重大隐私风险。此外,我们注意到,当攻击者具备相关知识或对生成模型拥有黑盒访问权限时,隐私威胁会显著增加。我们还发现,通过多目标优化的重构攻击甚至会增加识别机密样本的风险。

关键词

引用

@article{arxiv.2404.00696,
  title  = {Privacy Re-identification Attacks on Tabular GANs},
  author = {Abdallah Alshantti and Adil Rasheed and Frank Westad},
  journal= {arXiv preprint arXiv:2404.00696},
  year   = {2024}
}