深度强化学习攻击的特征刻画
机器学习
2022-02-18 v3 人工智能
密码学与安全
机器学习
摘要
近期研究表明,深度强化学习(DRL)模型易受对抗攻击,此类攻击通过对观测添加微小扰动来攻击DRL模型。然而,部分攻击假设可完全获取受害模型,部分则需大量计算,使其在现实应用中可行性较低。本文通过基于现实且高效的攻击研究DRL攻击的其他方面,进一步探索DRL的脆弱性。首先,当我们无法访问DRL模型参数时,我们调整并提出了高效的黑盒攻击。其次,为解决现有攻击的高计算需求,我们引入利用连续步骤间时间一致性的高效在线序列攻击。第三,我们探索攻击者在DRL设定中扰动其他方面(如环境动态)的可能性。最后,为考虑攻击者在物理世界中注入扰动的不完美性,我们设计了一种生成可打印鲁棒物理扰动的方法。该攻击在真实世界机器人上于多种条件下进行评估。我们在Atari游戏、机器人与自动驾驶等仿真环境以及真实世界机器人上进行了广泛实验,以比较所提攻击与基线方法的有效性。据我们所知,我们首次将对抗攻击应用于物理机器人上的DRL系统。
引用
@article{arxiv.1907.09470,
title = {Characterizing Attacks on Deep Reinforcement Learning},
author = {Xinlei Pan and Chaowei Xiao and Warren He and Shuang Yang and Jian Peng and Mingjie Sun and Jinfeng Yi and Zijiang Yang and Mingyan Liu and Bo Li and Dawn Song},
journal= {arXiv preprint arXiv:1907.09470},
year = {2022}
}
备注
AAMAS 2022, 13 pages, 6 figures