中文

ImpMIA:利用隐式偏置进行成员推断攻击

机器学习 2026-02-26 v3 密码学与安全 计算机视觉与模式识别

摘要

确定用于训练模型的哪些数据样本,称为成员推断攻击(MIA),是一个已深入研究且重要的问题,对数据隐私具有潜在影响。SotA方法(这些是黑盒攻击)依赖于训练许多辅助参考模型来模拟被攻击模型的行为。因此,它们依赖于在现实世界环境中很少成立的假设:(i)攻击者了解训练超参数;(ii)所有可用非训练样本都来自与训练数据相同的分布;(iii)训练数据在评估集中的比例已知。我们表明,删除这些假设会显著损害黑盒攻击的性能。我们引入ImpMIA,一种利用神经网络隐式偏置的成员推断攻击方法。基于最大边际隐式偏置理论,ImpMIA使用KKT最优性条件来识别训练样本——即那些梯度最强力地重构所训练模型参数的样本。我们的方法是基于优化的,无需训练参考模型,从而消除了对被攻击模型训练程序的任何知识/假设需求。虽然ImpMIA是一种白盒攻击(假设可访问模型权重),但考虑到许多模型通过Hugging Face等方式公开可用,这在逐渐变得更加现实。ImpMIA在仅知晓模型权重且训练数据的超集可用的情形下,相较于黑盒和白盒攻击在SotA性能方面表现出色。

关键词

引用

@article{arxiv.2510.10625,
  title  = {ImpMIA: Leveraging Implicit Bias for Membership Inference Attack},
  author = {Yuval Golbari and Navve Wasserman and Gal Vardi and Michal Irani},
  journal= {arXiv preprint arXiv:2510.10625},
  year   = {2026}
}