中文

l-Leaks:基于Logits的成员推断攻击

机器学习 2022-05-16 v1 人工智能 密码学与安全

摘要

机器学习(ML)在过去几十年取得了前所未有的进展。然而,由于训练数据的可记忆性,ML易受各种攻击,尤其是成员推断攻击(MIAs),其目标是推断模型的训练数据。迄今为止,大多数针对ML分类器的成员推断攻击利用与目标模型结构相同的影子模型。但经验结果表明,若影子模型不清楚目标模型的网络结构,这些攻击易被缓解。本文中,我们提出基于黑盒访问目标模型的攻击。我们将攻击命名为\textbf{l-Leaks}。l-Leaks遵循如下直觉:若建立的影子模型与目标模型足够相似,则 adversary 可利用影子模型的信息预测目标样本的成员性。训练目标模型的logits包含有价值的样本知识。我们通过学习目标模型的logits构建影子模型,使影子模型更相似于目标模型。于是影子模型对目标模型的成员样本具有充分置信度。我们还讨论了影子模型不同网络结构对攻击结果的影响。在不同网络与数据集上的实验表明,我们的两种攻击均取得强性能。

关键词

引用

@article{arxiv.2205.06469,
  title  = {l-Leaks: Membership Inference Attacks with Logits},
  author = {Shuhao Li and Yajie Wang and Yuanzhang Li and Yu-an Tan},
  journal= {arXiv preprint arXiv:2205.06469},
  year   = {2022}
}

备注

10pages,6figures