中文

神经网络的对抗重编程

机器学习 2019-09-12 v2 密码学与安全 计算机视觉与模式识别 机器学习

摘要

深度神经网络易受对抗攻击。在计算机视觉中,精心制作的图像扰动可导致神经网络犯错,例如将猫误认为计算机。先前的对抗攻击旨在降低模型性能或使机器学习模型产生攻击者预先选定的特定输出。我们引入的攻击则改为将目标模型重编程以执行攻击者选择的任务——攻击者无需为每个测试时输入指定或计算期望输出。该攻击找到单一对抗扰动,可加至机器学习模型的所有测试时输入,从而使模型执行对手选择的任务——即使模型未被训练来做此任务。因此这些扰动可被视为新任务的程序。我们在六个 ImageNet 分类模型上演示了对抗重编程,将这些模型重新用于执行计数任务,以及分类任务:将呈现为 ImageNet 模型输入的 MNIST 和 CIFAR-10 样本进行分类。

关键词

引用

@article{arxiv.1806.11146,
  title  = {Adversarial Reprogramming of Neural Networks},
  author = {Gamaleldin F. Elsayed and Ian Goodfellow and Jascha Sohl-Dickstein},
  journal= {arXiv preprint arXiv:1806.11146},
  year   = {2019}
}