不可学习数据示例的证明
摘要
在人工智能时代,利用公开数据已引发日益增加的数据隐私和知识产权(IP)泄露的担忧。为保障数据隐私和 IP 相关的领域知识, efforts 致力于使共享数据对未经授权的模型难以学习。现有方法通过经验优化的扰动应用于数据,以希望破坏输入与相应标签之间的相关性,从而将数据样本转换为不可学习示例(Unlearnable Examples, UEs)。然而,缺乏机制来验证 UEs 在不确定性未经授权模型及其训练程序下的鲁棒性,导致了若干未充分探讨的挑战。首先,难以量化 UEs 在不同训练运行中对未经授权对手的不可学习性,使防御的可靠性难以判断。尤其是,作为主要评估指标的经验测试准确率存在一般化误差,可能不真实地代表 UEs 的质量。这也为攻击者留下了空间,因为没有严格的保证能被攻击者实现的最大测试准确率。此外,我们发现,通过对学习权重轻微扰动,简单恢复攻击可以恢复在 UEs 上训练的分类器的干净任务性能。为缓解上述问题,本文提出了一种通过参数平滑来 certify 所谓 -Learnability 的机制,用于 certify 不可学习数据集。较低的 certify -Learnability 表示对数据集的更健壮和更有效的保护。具体而言,我们 1) 改进了 certify -Learnability 的紧密性,2) 设计了具有较低 -Learnability 的可证明不可学习示例(Provably Unlearnable Examples, PUEs)。
引用
@article{arxiv.2405.03316,
title = {Provably Unlearnable Data Examples},
author = {Derui Wang and Minhui Xue and Bo Li and Seyit Camtepe and Liming Zhu},
journal= {arXiv preprint arXiv:2405.03316},
year = {2024}
}
备注
Accepted to Network and Distributed System Security (NDSS) Symposium 2025, San Diego, CA, USA. Source code is available at https://github.com/NeuralSec/certified-data-learnability