中文

基于部分特征的成员推理攻击

机器学习 2025-12-24 v2 人工智能 密码学与安全

摘要

机器学习模型易受成员推理攻击,该攻击可用于判断给定样本是否出现在训练数据中。现有大多数方法假设攻击者能够完全访问目标样本的特征。然而,在许多现实场景中,这一假设并不成立,因为通常只能获得部分特征,从而限制了这些方法的适用性。在这项工作中,我们引入了部分特征成员推理(PFMI)场景,即对手仅能观察到每个样本的部分特征,并旨在推断该观察到的子集是否存在于训练集中。为了解决这个问题,我们提出了MRAD(记忆引导重建与异常检测),一个在白盒和黑盒设置下均可工作的两阶段攻击框架。在第一阶段,MRAD利用目标模型的潜在记忆来重建样本的未知特征。我们观察到,当已知特征不存在于训练集中时,重建的样本会显著偏离真实数据分布。因此,在第二阶段,我们使用异常检测算法来衡量重建样本与训练数据分布之间的偏差,从而判断已知特征是否属于训练集的成员。实证结果表明,MRAD在各种数据集上均有效,并且与现成的异常检测技术保持兼容。例如,在STL-10数据集上,即使缺失60%的特征,我们的攻击AUC值仍能达到约0.75。

关键词

引用

@article{arxiv.2508.06244,
  title  = {Membership Inference Attack with Partial Features},
  author = {Xurun Wang and Guangrui Liu and Xinjie Li and Haoyu He and Lin Yao and Zhongyun Hua and Weizhe Zhang},
  journal= {arXiv preprint arXiv:2508.06244},
  year   = {2025}
}