图生成模型与深度生成模型:度量差分隐私机制与预算对效用的影晌
机器学习
2024-08-30 v2 密码学与安全
摘要
采用差分隐私(DP)训练的 generative 模型可在降低隐私风险的同时生成合成数据。然而,厘清其隐私-效用权衡使得为特定设置/任务寻找最佳模型颇具挑战。本文通过刻画用于表格数据的 DP 生成模型如何在行与列间分配隐私预算(这是效用退化的主要来源之一)来弥合这一差距。我们比较了图生成模型与深度生成模型,聚焦于导致隐私预算消耗方式差异的关键因素,即底层建模技术、DP 机制与数据维度。通过我们的度量研究,我们阐明了使不同模型适用于各类设置与任务的特征。例如,我们发现图模型水平分配隐私预算,因而在固定训练时间内无法处理较宽的数据集;此外,在其所优化任务上的性能随数据增多单调提升,但也可能过拟合。深度生成模型每次迭代消耗预算,因此其随数据集维度变化的行为较不可预测,但更灵活,因为在更多特征上训练可能表现更好。而且,低隐私水平()可帮助某些模型泛化,取得优于不应用 DP 的结果。我们相信,通过依据数据集特征、期望隐私水平与下游任务筛选最佳候选模型,我们的工作将有助于 DP 合成数据技术的部署。
引用
@article{arxiv.2305.10994,
title = {Graphical vs. Deep Generative Models: Measuring the Impact of Differentially Private Mechanisms and Budgets on Utility},
author = {Georgi Ganev and Kai Xu and Emiliano De Cristofaro},
journal= {arXiv preprint arXiv:2305.10994},
year = {2024}
}
备注
A shorter version of this paper appears in the Proceedings of the 31st ACM Conference on Computer and Communications Security (ACM CCS 2024). This is the full version