中文

在保持边缘的差分隐私合成数据上训练线性模型的超额风险界

机器学习 2024-07-22 v2 密码学与安全

摘要

机器学习(ML)的日益广泛应用引发了人们的担忧,即 ML 模型可能会泄露对训练数据集做出贡献的个体的隐私信息。为了防止敏感数据泄露,我们考虑使用差分隐私(DP)合成训练数据而非真实训练数据来训练 ML 模型。合成数据的一个关键理想特性是能够保留原始分布的低阶边缘分布。我们的主要贡献包括,针对在连续且 Lipschitz 损失函数下基于此类合成数据训练的线性模型,给出了其超额经验风险的新上下界。我们在理论结果之外进行了广泛的实验。

关键词

引用

@article{arxiv.2402.04375,
  title  = {Bounding the Excess Risk for Linear Models Trained on Marginal-Preserving, Differentially-Private, Synthetic Data},
  author = {Yvonne Zhou and Mingyu Liang and Ivan Brugere and Dana Dachman-Soled and Danial Dervovic and Antigoni Polychroniadou and Min Wu},
  journal= {arXiv preprint arXiv:2402.04375},
  year   = {2024}
}