中文

匿名性解析:面向深度学习模型数据使用的实用审计框架

密码学与安全 2025-05-23 v3 人工智能

摘要

深度学习 (DL) 的兴起导致对训练数据的需求激增,这促使 DL 模型的创建者在互联网上搜寻训练材料。同时,用户往往对其数据(例如人脸图像)是否被用于训练 DL 模型缺乏控制,这引发了迫切的隐私关注。本工作提出 MembershipTracker,一款实用的数据审计工具,可使普通用户可靠地检测 DL 模型中未经授权的数据使用情况。我们将数据审计视为成员推断 (MI)。MembershipTracker 包括一个轻量级的数据标记组件,对目标数据进行小幅针对性修改,以便在训练此类数据的模型中被强烈记忆;以及基于 MI 的验证过程,用于审计模型是否对目标样本表现出强记忆。MembershipTracker 只需用户对训练集中极小比例的数据(0.005%至0.1%)进行标记,即可可靠检测未经授权的数据使用(平均 0% FPR@100% TPR)。我们展示 MembershipTracker 在包括在全大小为 ImageNet-1k 数据集上的行业规模训练等多种情形下均表现出高效。最后,我们在多种反措施下评估了 MembershipTracker。

关键词

引用

@article{arxiv.2409.06280,
  title  = {Anonymity Unveiled: A Practical Framework for Auditing Data Use in Deep Learning Models},
  author = {Zitao Chen and Karthik Pattabiraman},
  journal= {arXiv preprint arXiv:2409.06280},
  year   = {2025}
}

备注

A shorter version of this paper will appear in CCS'25