深度强化学习对策略诱导攻击的脆弱性
机器学习
2017-01-17 v1 人工智能
摘要
众所周知,深度学习分类器天生易受故意扰动输入(称为对抗样本)的操纵。在这项工作中,我们确定基于深度Q网络(DQNs)的强化学习技术同样易受对抗输入扰动的攻击,并验证了对抗样本在不同DQN模型间的可迁移性。此外,我们基于该漏洞提出了一类新型攻击,能够在DQNs的学习过程中实现策略操纵与诱导。我们提出了一种利用对抗样本可迁移性来对DQN实施策略诱导攻击的机制,并通过游戏学习场景的实验研究展示了其效能与影响。
引用
@article{arxiv.1701.04143,
title = {Vulnerability of Deep Reinforcement Learning to Policy Induction Attacks},
author = {Vahid Behzadan and Arslan Munir},
journal= {arXiv preprint arXiv:1701.04143},
year = {2017}
}
备注
14 pages, 5 figures, pre-print of submission to MLDM '17