中文

针对深度强化学习策略的实时对抗扰动:攻击与防御

机器学习 2022-09-26 v4 人工智能 密码学与安全

摘要

深度强化学习(DRL)易受对抗扰动的攻击。 adversary 可通过扰动智能体所观测的环境状态来误导 DRL 智能体的策略。现有攻击在原理上可行,但在实践中面临挑战,要么过于缓慢而无法实时欺骗 DRL 策略,要么修改存储在智能体记忆中的过往观测。我们表明,与所施加的个体输入无关的通用对抗扰动(UAP)能够有效且实时地欺骗 DRL 策略。我们引入了三种利用 UAP 的攻击变体。通过使用三款 Atari 2600 游戏的大量评估,我们表明我们的攻击是有效的,因为它们使三种不同 DRL 智能体的性能完全下降(高达 100%,即使扰动的 ll_\infty 界限小至 0.01)。其速度快于图像采集的帧率(60 Hz),且远快于先前的攻击(1.8\approx 1.8ms)。我们的攻击技术亦高效,在线计算成本约为 0.027\approx 0.027ms。通过使用两个涉及机器人运动的任务,我们确认我们的结果可推广至复杂 DRL 任务。此外,我们证明已知防御手段对通用扰动的有效性会减弱。我们引入了一种有效技术,可检测所有已知的针对 DRL 策略的对抗扰动,包括本文提出的所有通用扰动。

关键词

引用

@article{arxiv.2106.08746,
  title  = {Real-time Adversarial Perturbations against Deep Reinforcement Learning Policies: Attacks and Defenses},
  author = {Buse G. A. Tekgul and Shelly Wang and Samuel Marchal and N. Asokan},
  journal= {arXiv preprint arXiv:2106.08746},
  year   = {2022}
}

备注

Will appear in the proceedings of ESORICS 2022; 13 pages, 6 figures, 6 tables