中文

盲基准方法战胜面向基础模型的成员推断攻击

密码学与安全 2025-04-01 v2 计算与语言 机器学习

摘要

成员推断 (MI) 攻击试图确定数据样本是否用于训练机器学习模型。针对在未知 Web 数据上训练的基础模型,MI 攻击常用于检测版权保护的训练材料、衡量测试集的污染情况或审计机器学习的取消训练。不幸的是,我们发现针对基础模型的 MI 攻击评估存在缺陷,因为它们从不同的分布中抽取成员和非成员。对于 8 个已发布的 MI 评估数据集,我们表明盲攻击——即在不查看任何已训练模型的情况下区分成员和非成员分布——超过了最先进的 MI 攻击。现有的评估因此对基础模型训练数据的成员泄露毫无信息。

关键词

引用

@article{arxiv.2406.16201,
  title  = {Blind Baselines Beat Membership Inference Attacks for Foundation Models},
  author = {Debeshee Das and Jie Zhang and Florian Tramèr},
  journal= {arXiv preprint arXiv:2406.16201},
  year   = {2025}
}

备注

Accepted to be presented at DATA-FM @ ICLR 2025 and IEEE DLSP Workshop 2025