盲基准方法战胜面向基础模型的成员推断攻击
密码学与安全
2025-04-01 v2 计算与语言
机器学习
摘要
成员推断 (MI) 攻击试图确定数据样本是否用于训练机器学习模型。针对在未知 Web 数据上训练的基础模型,MI 攻击常用于检测版权保护的训练材料、衡量测试集的污染情况或审计机器学习的取消训练。不幸的是,我们发现针对基础模型的 MI 攻击评估存在缺陷,因为它们从不同的分布中抽取成员和非成员。对于 8 个已发布的 MI 评估数据集,我们表明盲攻击——即在不查看任何已训练模型的情况下区分成员和非成员分布——超过了最先进的 MI 攻击。现有的评估因此对基础模型训练数据的成员泄露毫无信息。
引用
@article{arxiv.2406.16201,
title = {Blind Baselines Beat Membership Inference Attacks for Foundation Models},
author = {Debeshee Das and Jie Zhang and Florian Tramèr},
journal= {arXiv preprint arXiv:2406.16201},
year = {2025}
}
备注
Accepted to be presented at DATA-FM @ ICLR 2025 and IEEE DLSP Workshop 2025