中文

自集成保护:训练检查点是优良的数据防护者

机器学习 2023-04-13 v3 密码学与安全 机器学习

摘要

随着数据日益重要,一家公司对发布数据会非常谨慎,因为竞争者可能利用其训练高性能模型,从而对该公司的商业竞争力构成巨大威胁。为阻止在数据上训练出优良模型,我们可以向其添加难以察觉的扰动。由于此类扰动旨在损害整个训练过程,它们应反映 DNN 训练的脆弱性,而非单个模型的脆弱性。基于这一新思路,我们寻求在训练中始终未被识别(从未被正确分类)的扰动样本。本文中,我们通过模型检查点的梯度揭示它们,形成所提出的自集成保护(SEP),其非常有效,因为 (1) 在常规训练中被忽略的样本上学习往往产生忽略常规样本的 DNN;(2) 检查点的跨模型梯度近乎正交,意味着它们与不同架构的 DNN 一样多样。也就是说,我们惊人的集成性能仅需要训练一个模型的计算量。通过在 3 个数据集和 5 种架构上与 9 个基线进行对比的广泛实验,SEP 被验证为一种新 state-of-the-art,例如,我们微小的 =2/255\ell_\infty=2/255 扰动将 CIFAR-10 ResNet18 的准确率从 94.56% 降至 14.68%,而已知最佳方法为 41.35%。代码见 https://github.com/Sizhe-Chen/SEP。

关键词

引用

@article{arxiv.2211.12005,
  title  = {Self-Ensemble Protection: Training Checkpoints Are Good Data Protectors},
  author = {Sizhe Chen and Geng Yuan and Xinwen Cheng and Yifan Gong and Minghai Qin and Yanzhi Wang and Xiaolin Huang},
  journal= {arXiv preprint arXiv:2211.12005},
  year   = {2023}
}

备注

ICLR 2023