中文

针对深度强化学习智能体的对抗攻击策略

机器学习 2019-11-14 v4 密码学与安全 机器学习

摘要

我们介绍了两种利用对抗样本攻击由深度强化学习算法训练的智能体的策略,即策略定时攻击和诱惑攻击。在策略定时攻击中,对手旨在通过仅在一个回合中的少量时间步上攻击智能体来最小化其奖励。将攻击活动限制在该子集内有助于防止智能体检测到攻击。我们提出了一种新颖的方法来确定何时应当构造并施加对抗样本。在诱惑攻击中,对手旨在将智能体引诱至指定的目标状态。这通过结合生成模型与规划算法实现:生成模型预测未来状态,而规划算法生成用于引诱智能体的首选动作序列。随后构造一系列对抗样本以引诱智能体采取该首选动作序列。我们将这两种策略应用于由最先进的深度强化学习算法(包括DQN和A3C)训练的智能体。在5个Atari游戏中,我们的策略定时攻击通过少攻击4倍的频率,实现了与均匀攻击(即每个时间步都攻击)相当程度的奖励削减。我们的诱惑攻击以超过70%的成功率将智能体引诱至指定目标状态。视频可在 http://yenchenlin.me/adversarial_attack_RL/ 获取。

关键词

引用

@article{arxiv.1703.06748,
  title  = {Tactics of Adversarial Attack on Deep Reinforcement Learning Agents},
  author = {Yen-Chen Lin and Zhang-Wei Hong and Yuan-Hong Liao and Meng-Li Shih and Ming-Yu Liu and Min Sun},
  journal= {arXiv preprint arXiv:1703.06748},
  year   = {2019}
}

备注

To Appear at IJCAI 2017. Project website: http://yenchenlin.me/adversarial_attack_RL/