中文

多方机器学习中数据集属性的泄露

机器学习 2021-06-21 v3 密码学与安全 机器学习

摘要

安全多方机器学习允许多个参与方在其汇集的数据上构建模型,以提高效用,同时不显式地相互共享数据。我们表明,即使参与方仅获得最终模型的黑盒访问权限,这种多方计算也可能导致全局数据集属性在参与方之间泄露。特别地,一个“好奇的”参与方可以高精度地推断出其他参与方数据中敏感属性的分布。这引发了对整个数据集属性(而非单个数据记录)机密性的担忧。我们证明,我们的攻击可以泄露不同类型数据集中群体层面的属性,包括表格、文本和图数据。为了理解和衡量泄露的来源,我们考虑了几种敏感属性与其余数据之间的相关性模型。通过使用多种机器学习模型,我们表明,即使敏感属性未包含在训练数据中,并且与其他属性或目标变量的相关性较低,泄露仍然会发生。

关键词

引用

@article{arxiv.2006.07267,
  title  = {Leakage of Dataset Properties in Multi-Party Machine Learning},
  author = {Wanrong Zhang and Shruti Tople and Olga Ohrimenko},
  journal= {arXiv preprint arXiv:2006.07267},
  year   = {2021}
}

备注

Published in USENIX Security Symposium, 2021