中文

Semi-Leak:针对半监督学习的成员推断攻击

密码学与安全 2022-07-27 v1 计算机视觉与模式识别 机器学习

摘要

半监督学习(SSL)利用有标签和无标签数据训练机器学习(ML)模型。最先进的 SSL 方法可通过利用远少于监督学习的标签数据达到可比性能。然而,多数现有工作聚焦于提升 SSL 性能。本工作中,我们从另一角度研究 SSL 的训练数据隐私。具体而言,我们提出首个基于数据增强的成员推断攻击,针对由 SSL 训练的 ML 模型。给定数据样本和对模型的黑盒访问,成员推断攻击的目标是判断该数据样本是否属于模型的训练数据集。我们的评估表明,所提攻击可稳定超越现有成员推断攻击,并对由 SSL 训练的模型取得最佳性能。此外,我们揭示 SSL 中成员泄露的原因不同于监督学习中普遍认同的原因,即过拟合(训练与测试精度之间的差距)。我们观察到 SSL 模型对测试数据泛化良好(几乎 0 过拟合),但通过给出更自信的预测(无论正确与否)来“记忆”训练数据。我们还探索早停作为防止针对 SSL 的成员推断攻击的对策。结果表明早停可缓解成员推断攻击,但代价是模型效用下降。

关键词

引用

@article{arxiv.2207.12535,
  title  = {Semi-Leak: Membership Inference Attacks Against Semi-supervised Learning},
  author = {Xinlei He and Hongbin Liu and Neil Zhenqiang Gong and Yang Zhang},
  journal= {arXiv preprint arXiv:2207.12535},
  year   = {2022}
}

备注

Accepted to ECCV 2022