中文

DTGAN:面向表格GAN的差分隐私训练

机器学习 2021-08-03 v3

摘要

表格生成对抗网络(TGAN)近来应运而生,以满足合成表格数据(最广泛使用的数据格式)的需求。虽然合成表格数据具有符合隐私法规的优势,但由于训练过程中对真实数据属性进行插值,仍存在通过推理攻击导致隐私泄露的风险。差分隐私(DP)训练算法通过注入统计噪声来防止隐私泄露,为训练机器学习模型提供理论保证。然而,将DP应用于TGAN的挑战在于确定最优的框架(即PATE/DP-SGD)和神经网络(即生成器/判别器)来注入噪声,从而在给定隐私保证下良好保持数据效用。本文提出DTGAN,一种新颖的条件Wasserstein表格GAN,包含DTGAN_G和DTGAN_D两种变体,用于详细比较分别使用DP-SGD训练生成器与判别器的表格GAN。我们阐明了使用复杂损失函数(即分类与信息损失)训练生成器所需的高质量表格数据合成相关的隐私分析。此外,我们针对成员推理攻击与属性推理攻击,严格地从经验上评估DP所提供的理论隐私保证。在3个数据集上的结果表明,DP-SGD框架优于PATE,且DP判别器对于训练收敛更为最优。因此,我们发现(i)与先前研究相比,在严格隐私预算epsilon = 1下,DTGAN_D能够跨4个ML模型保持最高数据效用,平均精度分数提升达18%;(ii)DP通过将成员攻击的成功概率限制为接近50%,有效防止了推理攻击造成的隐私损失。

关键词

引用

@article{arxiv.2107.02521,
  title  = {DTGAN: Differential Private Training for Tabular GANs},
  author = {Aditya Kunar and Robert Birke and Zilong Zhao and Lydia Chen},
  journal= {arXiv preprint arXiv:2107.02521},
  year   = {2021}
}

备注

16 pages, 4 figures and 5 tables, submitted to the ACML 2021 conference