中文

合成数据异常值: navigating 身份披露风险

机器学习 2024-06-06 v1 密码学与安全

摘要

多个合成数据生成模型相继涌现,其中深度学习模型因其能够捕捉原始数据特征而成为主导。然而,合成数据与原始数据的相似性引发了对个人隐私保护的重要质疑。由于合成数据被视为完全保护个人信息的手段,目前的大量研究忽略了重识别风险的影响。特别是,对异常值的关注有限,尽管其在隐私保护方面具有重要性。本文我们分析了合成数据关于异常值的隐私问题。我们的主要发现表明,异常值通过链式攻击进行重识别是可行且容易实现的。此外,诸如差分隐私等额外安全措施可以防止重识别,但会以牺牲数据实用性为代价。

关键词

引用

@article{arxiv.2406.02736,
  title  = {Synthetic Data Outliers: Navigating Identity Disclosure},
  author = {Carolina Trindade and Luís Antunes and Tânia Carvalho and Nuno Moniz},
  journal= {arXiv preprint arXiv:2406.02736},
  year   = {2024}
}