成员推断攻击无法证明模型是在您的数据上训练的
机器学习
2025-03-10 v2 密码学与安全
摘要
我们考虑训练数据证明的问题,即数据创建者或所有者希望向第三方证明某个机器学习模型是在其数据上训练的。训练数据证明在针对在网页规模数据上训练的基础模型提起的诉讼中发挥着关键作用。许多先前的工作建议使用成员推断攻击来实现训练数据证明。我们认为这种方法根本不可靠:为了提供令人信服的证据,数据创建者需要证明其攻击具有低误报率,即攻击的输出在模型未在目标数据上训练的假设下不太可能。然而,从该原假设中进行抽样是不可能的,因为我们不知道训练集的确切内容,也不能(有效地)重新训练大型基础模型。我们得出结论,提出两种前进路径,通过显示数据提取攻击和针对特殊 canary 数据的成员推断可以用于创建可靠的训练数据证明。
引用
@article{arxiv.2409.19798,
title = {Membership Inference Attacks Cannot Prove that a Model Was Trained On Your Data},
author = {Jie Zhang and Debeshee Das and Gautam Kamath and Florian Tramèr},
journal= {arXiv preprint arXiv:2409.19798},
year = {2025}
}
备注
position paper at IEEE SaTML 2025