中文

深度强化学习对策略诱导攻击的脆弱性

机器学习 2017-01-17 v1 人工智能

摘要

众所周知,深度学习分类器天生易受故意扰动输入(称为对抗样本)的操纵。在这项工作中,我们确定基于深度Q网络(DQNs)的强化学习技术同样易受对抗输入扰动的攻击,并验证了对抗样本在不同DQN模型间的可迁移性。此外,我们基于该漏洞提出了一类新型攻击,能够在DQNs的学习过程中实现策略操纵与诱导。我们提出了一种利用对抗样本可迁移性来对DQN实施策略诱导攻击的机制,并通过游戏学习场景的实验研究展示了其效能与影响。

关键词

引用

@article{arxiv.1701.04143,
  title  = {Vulnerability of Deep Reinforcement Learning to Policy Induction Attacks},
  author = {Vahid Behzadan and Arslan Munir},
  journal= {arXiv preprint arXiv:1701.04143},
  year   = {2017}
}

备注

14 pages, 5 figures, pre-print of submission to MLDM '17