极简攻击:欺骗深度强化学习策略所需的最小代价
机器学习
2020-10-30 v5 人工智能
计算机视觉与模式识别
机器学习
摘要
近期研究揭示,基于神经网络的策略很容易被对抗样本欺骗。然而,多数先前工作假设白盒策略访问并分析扰动每帧每个像素的影响,本文则对对抗样本生成采取更具限制性的视角——旨在揭示模型脆弱性的极限。具体地,我们通过定义三个关键设定来探索极简攻击:(1)黑盒策略访问:攻击者仅能访问 RL 策略的输入(状态)与输出(动作概率);(2)部分状态对抗:仅扰动若干像素,极端情况为单像素对抗;(3)战术择机攻击:仅战术性地选择关键帧进行攻击。我们结合这三个关键设定构建对抗攻击,并通过考察四种完全训练的最先进策略,在六款 Atari 游戏上探究其效力。例如在 Breakout 中,我们惊讶地发现:(i)所有策略仅修改输入状态的 0.01% 即出现显著性能退化;(ii)由 DQN 训练的策略仅被扰动 1% 的帧便完全受骗。
引用
@article{arxiv.1911.03849,
title = {Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy},
author = {Xinghua Qu and Zhu Sun and Yew-Soon Ong and Abhishek Gupta and Pengfei Wei},
journal= {arXiv preprint arXiv:1911.03849},
year = {2020}
}
备注
Accepted by IEEE Transactions on Cognitive and Developmental System