中文

利用诱导噪声欺骗对抗训练

机器学习 2021-11-22 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

对抗训练被广泛认为是一种提升模型抵御对抗攻击鲁棒性的可靠方法。然而,在本文中我们表明,当在一种投毒数据上训练时,对抗训练也可能被欺骗而表现出灾难性行为,例如在 CIFAR-10 数据集上鲁棒测试准确率 <1%<1\% 而鲁棒训练准确率 >90%>90\%。此前,训练数据中投毒的其他类型噪声已成功欺骗标准训练(在 CIFAR-10 数据集上标准测试准确率 15.8%15.8\% 而标准训练准确率 99.9%99.9\%),但采用对抗训练时这些投毒可被轻易去除。因此,我们旨在设计一种名为 ADVIN 的新型诱导噪声,它是训练数据中不可去除的投毒。ADVIN 不仅能大幅降低对抗训练的鲁棒性,例如在 CIFAR-10 数据集上从 51.7%51.7\% 降至 0.57%0.57\%,还能有效欺骗标准训练(标准测试准确率 13.1%13.1\% 而标准训练准确率 100%100\%)。此外,ADVIN 可用于防止个人数据(如自拍)在标准或对抗训练下被未经授权地利用。

关键词

引用

@article{arxiv.2111.10130,
  title  = {Fooling Adversarial Training with Inducing Noise},
  author = {Zhirui Wang and Yifei Wang and Yisen Wang},
  journal= {arXiv preprint arXiv:2111.10130},
  year   = {2021}
}