合成数据隐私指标
机器学习
2025-01-08 v1 人工智能
摘要
生成式 AI 的 recent 进展使得能够创建与真实数据相当准确的合成数据集,这些数据集可用于训练 AI 模型,为统计性见解提供动力,同时在提供强大隐私保证的同时促进了对敏感数据集的合作。有效测量合成数据的 empirical 隐私是这一过程中重要的步骤。然而,尽管每天都有大量新的隐私指标被发表,但目前尚无统一标准。本文我们审查了包括对抗性攻击模拟的流行指标的优缺点。我们也审查了当前最佳实践,以增强生成模型创建的数据隐私(例如差分隐私)。
引用
@article{arxiv.2501.03941,
title = {Synthetic Data Privacy Metrics},
author = {Amy Steier and Lipika Ramaswamy and Andre Manoel and Alexa Haushalter},
journal= {arXiv preprint arXiv:2501.03941},
year = {2025}
}
备注
14 pages, 2 figures