中文

关于不可卸载数据的综述

机器学习 2025-04-02 v2 人工智能

摘要

不可卸载数据(Unlearnable Data, ULD)作为一种创新防御技术,已涌现出以防止机器学习模型从特定数据中学习有意义模式,从而保护数据隐私和安全。通过向训练数据引入扰动,ULD 会降低模型性能,使未授权模型难以提取有用表征。尽管ULD的重要性日益提升,但现有综述主要聚焦于相关领域,如对抗攻击和机器遗忘,未能将ULD作为独立研究领域加以关注。本综述填补了这一空白,提供了ULD的全面回顾,审查了不可卸载数据生成方法、公共基准、评估指标、理论基础及实际应用。我们比较了不同ULD方法,分析了其在不可卸载性、隐形性、效率和鲁棒性方面的优势、局限及权衡。此外,讨论了关键挑战,如在扰动隐形性与模型性能下降之间取得平衡以及ULD生成的计算复杂度问题。最后,我们指出了推动ULD有效性和适用性发展的潜在研究方向,凸显其在机器学习数据保护演变画布中的潜在至关重要作用。

关键词

引用

@article{arxiv.2503.23536,
  title  = {A Survey on Unlearnable Data},
  author = {Jiahao Li and Yiqiang Chen and Yunbing Xing and Yang Gu and Xiangyuan Lan},
  journal= {arXiv preprint arXiv:2503.23536},
  year   = {2025}
}

备注

31 pages, 3 figures, Code in https://github.com/LiJiahao-Alex/Awesome-UnLearnable-Data