基于差分审计的数据溯源
密码学与安全
2022-09-07 v1 人工智能
数据库
机器学习
摘要
审计数据溯源(ADP),即审计某条特定数据是否已被用于训练机器学习模型,是数据溯源中的一个重要问题。现有审计技术(如影子审计方法)已在某些条件下证明了该任务的可行性,例如需要目标模型的标签信息可用且已知其训练协议。遗憾的是,在真实应用中这两个条件往往都不满足。本文提出基于差分审计的数据溯源(DPDA),这是一种实用的数据溯源审计框架,采用基于统计显著差分的另一种方法:经过精心设计的变换后,来自目标模型训练集的扰动输入数据所导致的输出变化,远比来自非训练集的数据剧烈。该框架使审计者无需借助带标签的输出数据训练任何影子模型即可区分训练数据与非训练数据。此外,我们提出了两种有效的审计函数实现:加性实现与乘性实现。我们在真实数据集上的评估结果表明了所提审计技术的有效性。
引用
@article{arxiv.2209.01538,
title = {Data Provenance via Differential Auditing},
author = {Xin Mu and Ming Pang and Feida Zhu},
journal= {arXiv preprint arXiv:2209.01538},
year = {2022}
}