机器学习系统中的数据集版权审计 SoK
密码学与安全
2025-05-27 v2 机器学习
摘要
随着机器学习 (ML) 系统的广泛实施,尤其是大型 ML 模型的出现,人们对海量数据的需求日益迫切。然而,这不可避免地引发数据侵权和滥用问题,例如使用未经授权的网络艺术作品或人脸图像训练 ML 模型。为解决这一问题,已对模型训练数据集的版权进行多方审计。然而,现有解决方案在审计假设和能力方面各不相同,难以比较其优势与局限。此外,鲁棒性评估通常仅考虑 ML 管道的部分内容,几乎无法反映算法在实际 ML 应用中的性能。因此,必须从实际部署角度审视当前的数据集版权审计工具,考察其有效性和局限性。具体而言,我们根据是否需要对原始数据集进行修改,将数据集版权审计研究分为两大主要类别:侵入式方法和非侵入式方法。随后,我们将侵入式方法细分为不同的水印注入选项,并使用各种指纹来审查非侵入式方法。为了总结我们的发现,我们提供详细的参考表格,突出关键要点,并指出当前文献中未解决的问题。通过结合 ML 系统中的管道并分析前述研究,我们指出了若干未来方向,以使审计工具更适合实际的版权保护需求。
引用
@article{arxiv.2410.16618,
title = {SoK: Dataset Copyright Auditing in Machine Learning Systems},
author = {Linkang Du and Xuanru Zhou and Min Chen and Chusong Zhang and Zhou Su and Peng Cheng and Jiming Chen and Zhikun Zhang},
journal= {arXiv preprint arXiv:2410.16618},
year = {2025}
}
备注
To appear in the IEEE Symposium on Security and Privacy 2025, San Francisco, CA, USA