中文

针对强化学习的自适应奖励投毒攻击

机器学习 2020-06-24 v2 人工智能 密码学与安全 机器学习

摘要

在针对强化学习(RL)的奖励投毒攻击中,攻击者可在每一步将环境奖励rtr_t扰动为rt+δtr_t+\delta_t,以迫使RL智能体学习恶意策略。我们按对δt\delta_t的无穷范数约束对此类攻击分类:我们给出一下界,低于该界则奖励投毒攻击不可行且RL被证明安全;我们给出相应上界,高于该界则攻击可行。可行攻击可进一步分为非自适应(其中δt\delta_t仅依赖于(st,at,st+1)(s_t,a_t, s_{t+1}))或自适应(其中δt\delta_t进一步依赖于时刻tt的RL智能体学习过程)。非自适应攻击是先前工作的焦点。然而,我们证明在温和条件下,自适应攻击可在关于状态空间大小S|S|的多项式步数内实现恶意策略,而非自适应攻击需要指数步数。我们给出构造性证明:一种快速自适应攻击策略实现了该多项式速率。最后,我们实证表明攻击者可使用最先进的深度RL技术找到有效的奖励投毒攻击。

关键词

引用

@article{arxiv.2003.12613,
  title  = {Adaptive Reward-Poisoning Attacks against Reinforcement Learning},
  author = {Xuezhou Zhang and Yuzhe Ma and Adish Singla and Xiaojin Zhu},
  journal= {arXiv preprint arXiv:2003.12613},
  year   = {2020}
}