不可泛化样本
机器学习
2024-04-23 v1 计算机视觉与模式识别
摘要
当代深度学习模型的训练严重依赖公开数据,这带来了在线数据未经授权访问的风险,并引发了对数据隐私的担忧。当前创建不可学习数据的方法涉及加入精心设计的小噪声,但这些方法严格限制了数据的可用性,忽视了其在授权场景中的潜在用途。在本文中,我们将不可学习数据的概念扩展到条件数据可学习性,并引入了\textbf{不}可\textbf{泛}化\textbf{样}本(UGEs)。UGEs对授权用户表现出可学习性,同时对潜在黑客保持不可学习性。保护者定义授权网络,并优化UGEs以匹配原始数据及其不可泛化版本的梯度,从而确保可学习性。为了防止未授权学习,UGEs通过在公共特征空间中最大化指定的距离损失进行训练。此外,为了进一步保护授权方免受潜在攻击,我们引入了额外的反蒸馏优化。在多个数据集和不同网络上的实验结果表明,所提出的UGEs框架在保持数据可用性的同时,降低了黑客网络上的训练性能,即使在不同类型的攻击下也是如此。
引用
@article{arxiv.2404.14016,
title = {Ungeneralizable Examples},
author = {Jingwen Ye and Xinchao Wang},
journal= {arXiv preprint arXiv:2404.14016},
year = {2024}
}
备注
Accepted by CVPR2024