规避深层神经网络中的数据源头
计算机视觉与模式识别
2025-08-05 v1 密码学与安全
摘要
现代过参数化的深度模型高度依赖数据,大规模通用和领域特定数据集是快速进展的基石。然而,许多数据集是专有的或包含敏感信息,限制了不受限制的模型训练。在数据盗窃无法完全防止的开放世界中,数据所有权验证(DOV)作为一种保护版权的方法,通过检测未授权模型训练和追踪非法活动而引起了关注。由于其多样性和优异的隐身性,规避 DOV 被认为极具挑战性。然而,本文指出,过去的研究在评估中依赖过于简化的规避攻击,导致人们对安全性产生了虚假的感知。我们引入一个统一的规避框架,教师模型首先从版权数据集中学习,然后通过一个来自分布外(OOD)数据集的中介,将任务相关但与标识无关的领域知识传递给_surrogate 学生。利用视觉-语言模型和大型语言模型,我们从 OOD 图库集中挑选出最具信息性和可靠性的子集作为最终的传递集,并提出选择性地传递任务导向的知识,以实现更好的泛化性与规避效果之间的平衡。跨越覆盖十一种 DOV 方法的多个数据集上的实验表明,我们的方法同时消除了所有版权标识,且在泛化性和规避效果上显著优于九种最新规避攻击方法,计算开销适中。作为概念验证,我们揭示了当前 DOV 方法的关键漏洞,凸显了为提高实用性而需要长期发展的必要性。
引用
@article{arxiv.2508.01074,
title = {Evading Data Provenance in Deep Neural Networks},
author = {Hongyu Zhu and Sichu Liang and Wenwen Wang and Zhuomeng Zhang and Fangqi Li and Shi-Lin Wang},
journal= {arXiv preprint arXiv:2508.01074},
year = {2025}
}
备注
ICCV 2025 Highlight