使用合成数据进行训练是否真正保护了隐私?
密码学与安全
2025-02-19 v1 机器学习
摘要
随着合成数据在机器学习任务中的应用日益流行,许多方法( lack formal differential privacy guarantees)使用合成数据进行训练,这些方法常常明确或隐含地声称能够保护原始训练数据的隐私。在本工作中,我们探讨了四种不同的训练范式:核心集选择、数据蒸馏、无数据知识蒸馏以及来自扩散模型生成的合成数据。虽然所有这些方法都利用合成数据进行训练,但它们对隐私保护的结论差异巨大。我们警示,经验方法的隐私保护需要谨慎且严格的评估;否则,他们可能提供一种虚假的隐私感。
引用
@article{arxiv.2502.12976,
title = {Does Training with Synthetic Data Truly Protect Privacy?},
author = {Yunpeng Zhao and Jie Zhang},
journal= {arXiv preprint arXiv:2502.12976},
year = {2025}
}
备注
Accepted to ICLR 2025