生成式与预测式机器学习模型的实证隐私评估——实践中的回顾与挑战
机器学习
2024-11-20 v1
摘要
合成数据生成器在使用差分隐私等隐私保护技术进行训练时,有望生成具有形式化隐私保证的合成数据,从而促进敏感数据的共享。然而,在部署生成式技术之前,实证评估与生成的合成数据相关的隐私风险至关重要。本文概述了基于机器学习的生成式与预测式模型中实证隐私评估的关键概念和假设。然后,本文探讨了在包含数百万训练记录的使用场景(例如来自统计机构和医疗保健提供者的数据)下,生成式模型隐私评估的实际挑战。我们的发现表明,旨在验证训练算法正确运行的方法对大型数据集是有效的,但它们通常假设的对手在许多场景中是不切实际的。基于这些发现,我们强调了评估的计算可行性与假设威胁模型的真实性水平之间的关键权衡。最后,我们以对未来研究的想法和建议作为总结。
引用
@article{arxiv.2411.12451,
title = {Empirical Privacy Evaluations of Generative and Predictive Machine Learning Models -- A review and challenges for practice},
author = {Flavio Hafner and Chang Sun},
journal= {arXiv preprint arXiv:2411.12451},
year = {2024}
}