中文

用于欺骗神经网络的深度 Q 学习

机器学习 2018-11-15 v1 人工智能 机器学习

摘要

深度学习模型易受外部攻击。本文提出一种基于强化学习(RL)的方法,为预训练(目标)模型生成对抗样本。我们假设一种半黑盒设定,其中 adversary 对目标模型的唯一访问是输入查询所得的类概率。我们训练一个深度 Q 网络(DQN)智能体,其随着经验学习仅攻击图像像素的一小部分以生成非定向对抗图像。起初,智能体通过依次修改随机图像像素集合来探索环境,并观察其对类概率的影响。在一个回合结束时,若成功(失败)改变图像标签则获得正(负)奖励。在 MNIST、CIFAR-10 和 Imagenet 数据集上的实验结果表明,我们的 RL 框架能够学习到有效的攻击策略。

关键词

引用

@article{arxiv.1811.05521,
  title  = {Deep Q learning for fooling neural networks},
  author = {Mandar Kulkarni},
  journal= {arXiv preprint arXiv:1811.05521},
  year   = {2018}
}