中文

不可避免的追逐:复现 PATE-GAN 的基准测试、审计与调试

机器学习 2025-02-11 v3 密码学与安全

摘要

由差分隐私(DP)生成模型创建的合成数据在实际场景中日益受到欢迎。在此背景下,PATE-GAN 作为一种结合生成对抗网络(GAN)与私有聚合教师集合(PATE)训练方法的算法,已成为最流行的算法之一。本文旨在复现原始 PATE-GAN 论文中的效用评估,比较现有实现方式,并进行隐私审计。更准确地说,我们分析并基准测试了六种开源 PATE-GAN 实现,包括三种来自(部分)原作者的实现。首先,我们揭示了架构偏差,实证表明没有一种实现能复现原始论文中报告的效用性能。随后,我们提出深入的隐私评估,包括 DP 审计,显示所有实现都泄露的隐私超过预期。此外,我们在这些六种开源实现中发现了 19 起隐私违规和 5 起其他错误。最后,我们的代码库可在:https://github.com/spalabucr/pategan-audit 获取。

关键词

引用

@article{arxiv.2406.13985,
  title  = {The Elusive Pursuit of Reproducing PATE-GAN: Benchmarking, Auditing, Debugging},
  author = {Georgi Ganev and Meenatchi Sundaram Muthu Selva Annamalai and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2406.13985},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research (TMLR 2025). Please cite the TMLR version