SMOTE-DP:利用合成数据改善隐私-效用权衡
机器学习
2025-06-03 v1 密码学与安全
机器学习
摘要
隐私保护数据发布(包括合成数据共享)通常在隐私与效用之间存在权衡。合成数据在平衡这种权衡方面通常比数据匿名化更有效,但也并非没有挑战。在源数据上训练的生成模型所产生的合成数据可能会无意中泄露有关异常值的信息。专门为保护隐私而设计的技术(例如引入噪声以满足差分隐私)通常会导致不可预测且显著的效用损失。在这项工作中,我们表明,通过合适的合成数据生成机制,可以在没有显著效用损失的情况下实现强大的隐私保护。产生收缩数据模式的合成数据生成器(如合成少数类过采样技术,SMOTE)可以增强差分隐私数据生成器,从而发挥两者的优势。我们通过理论和实证证明,这种 SMOTE-DP 技术生成的合成数据不仅能确保稳健的隐私保护,还能在下游学习任务中保持效用。
引用
@article{arxiv.2506.01907,
title = {SMOTE-DP: Improving Privacy-Utility Tradeoff with Synthetic Data},
author = {Yan Zhou and Bradley Malin and Murat Kantarcioglu},
journal= {arXiv preprint arXiv:2506.01907},
year = {2025}
}