标签差分隐私能否防止标签推断攻击?
机器学习
2023-06-06 v2
摘要
标签差分隐私 (label-DP) 是一种流行的框架,用于在具有公开特征和敏感私有标签的数据集上训练私有 ML 模型。尽管具有严格的隐私保证,但已观察到在实践中 label-DP 并不能排除标签推断攻击 (LIAs):用 label-DP 训练的模型可在公开训练特征上评估,以高准确度恢复其旨在保护的那些私有标签。在这项工作中,我们认为这一现象并不矛盾,并且 label-DP 旨在限制 LIA 攻击者的优势,相较于使用贝叶斯分类器预测训练标签。在 label-DP 时该优势为零,因此最优攻击是根据贝叶斯分类器进行预测且与训练标签无关。我们的界限显示了 label-DP 所赋予的语义保护,并给出了关于如何选择 以将 LIAs 威胁限制在特定水平以下的指导。最后,我们通过实验证明,我们的结果紧密捕捉了在合成和真实世界数据集上模拟攻击的行为。
引用
@article{arxiv.2202.12968,
title = {Does Label Differential Privacy Prevent Label Inference Attacks?},
author = {Ruihan Wu and Jin Peng Zhou and Kilian Q. Weinberger and Chuan Guo},
journal= {arXiv preprint arXiv:2202.12968},
year = {2023}
}