中文

洗牌还是不洗牌:审计带洗牌的DP-SGD

密码学与安全 2025-12-15 v3 机器学习

摘要

差分隐私随机梯度下降(DP-SGD)算法支持训练具有形式化差分隐私(DP)保证的机器学习(ML)模型。传统上,DP-SGD在每次迭代中使用泊松子采样来分批处理训练数据。最近,由于更好的兼容性和更低的计算开销,洗牌已成为一种常见的替代方案。然而,在洗牌下计算严格的理论DP保证仍然是一个悬而未决的问题。因此,使用洗牌训练的模型通常被当作使用了泊松子采样来评估,这可能导致不正确的隐私保证。这引出了一个引人注目的研究问题:我们能否验证使用洗牌的最先进模型所报告的理论DP保证与其实际泄露之间是否存在差距?为此,我们定义了新颖的DP审计程序来分析带洗牌的DP-SGD,并衡量它们在针对不同批次大小、隐私预算和威胁模型时,紧密估计隐私泄露的能力。总体而言,我们证明使用这种方法训练的DP模型大大高估了其隐私保证(高达4倍)。然而,我们也发现,理论上的泊松DP保证与洗牌的实际隐私泄露之间的差距,在所有参数设置和威胁模型下并不一致。最后,我们研究了洗牌过程的两种常见变体,它们导致了更严重的隐私泄露(高达10倍)。总的来说,我们的工作强调了在缺乏严格分析方法的情况下,使用洗牌替代泊松子采样的风险。

关键词

引用

@article{arxiv.2411.10614,
  title  = {To Shuffle or not to Shuffle: Auditing DP-SGD with Shuffling},
  author = {Meenatchi Sundaram Muthu Selva Annamalai and Borja Balle and Jamie Hayes and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2411.10614},
  year   = {2025}
}

备注

Published in the Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026) -- please cite the NDSS version