针对深度强化学习的隐蔽且高效的对抗攻击
密码学与安全
2020-05-15 v1 人工智能
机器学习
摘要
针对常规深度学习(DL)系统与算法的对抗攻击已被广泛研究,并提出了各种防御方法。然而,此类攻击针对深度强化学习(DRL)的可能性与可行性较少被探索。由于 DRL 已在各种复杂任务中取得巨大成功,设计有效的对抗攻击是构建鲁棒 DRL 算法不可或缺的先决条件。在本文中,我们引入两种新颖的对抗攻击技术,以\emph{隐蔽}且\emph{高效}地攻击 DRL 智能体。这两种技术使对手能够在最少的一组关键时刻注入对抗样本,同时对智能体造成最严重损害。第一种技术是\emph{关键点攻击}:对手建立模型预测未来环境状态与智能体动作,评估每种可能攻击策略的损害,并选择最优策略。第二种技术是\emph{对抗攻击}:对手自动学习一个领域无关模型,以发现一幕中攻击智能体的关键时刻。实验结果表明了我们技术的有效性。具体而言,为成功攻击 DRL 智能体,我们的关键点技术仅需 1 步(TORCS)或 2 步(Atari Pong 和 Breakout),而对抗技术需要少于 5 步(4 个 Mujoco 任务),相比最先进的方法有显著改进。
引用
@article{arxiv.2005.07099,
title = {Stealthy and Efficient Adversarial Attacks against Deep Reinforcement Learning},
author = {Jianwen Sun and Tianwei Zhang and Xiaofei Xie and Lei Ma and Yan Zheng and Kangjie Chen and Yang Liu},
journal= {arXiv preprint arXiv:2005.07099},
year = {2020}
}