中文

合成数据隐私指标

机器学习 2025-01-08 v1 人工智能

摘要

生成式 AI 的 recent 进展使得能够创建与真实数据相当准确的合成数据集,这些数据集可用于训练 AI 模型,为统计性见解提供动力,同时在提供强大隐私保证的同时促进了对敏感数据集的合作。有效测量合成数据的 empirical 隐私是这一过程中重要的步骤。然而,尽管每天都有大量新的隐私指标被发表,但目前尚无统一标准。本文我们审查了包括对抗性攻击模拟的流行指标的优缺点。我们也审查了当前最佳实践,以增强生成模型创建的数据隐私(例如差分隐私)。

关键词

引用

@article{arxiv.2501.03941,
  title  = {Synthetic Data Privacy Metrics},
  author = {Amy Steier and Lipika Ramaswamy and Andre Manoel and Alexa Haushalter},
  journal= {arXiv preprint arXiv:2501.03941},
  year   = {2025}
}

备注

14 pages, 2 figures