视觉 ML 模型的实例级数据用途审计
密码学与安全
2025-09-17 v2 机器学习
摘要
机器学习系统中未经授权数据使用的法律争议日益增长,凸显了确保 ML 系统可 accountability 与 transparency 所需可靠数据用途审计机制的迫切性。我们提出了首个主动的、基于实例的数据用途审计方法,旨在使数据所有者能够审计其单个数据实例在 ML 模型中的使用情况,从而提供比以往工作更细粒度的审计结果。为此,我们的研究概括化了之前的工作,将黑盒成员推断和顺序假设检验相结合的方法,扩大了其应用范围,同时保留了其标志性的可量化和可调节的误检率。我们在三种类型的视觉 ML 模型上进行评估:图像分类器、视觉编码器以及视觉语言模型(对比语言-图像预训练(CLIP)和自举语言-图像预训练(BLIP)模型)。此外,我们还应用了该方法来评估两种最先进的近似遗忘方法的性能。作为值得注意的第二项贡献,我们的工作揭示了即使牺牲约 10% 的模型效用,两种方法也未能成功地从图像分类器和 CLIP 模型中移除未被遗忘的数据实例的影响。
引用
@article{arxiv.2503.22413,
title = {Instance-Level Data-Use Auditing of Visual ML Models},
author = {Zonghao Huang and Neil Zhenqiang Gong and Michael K. Reiter},
journal= {arXiv preprint arXiv:2503.22413},
year = {2025}
}