针对强化学习的自适应奖励投毒攻击
机器学习
2020-06-24 v2 人工智能
密码学与安全
机器学习
摘要
在针对强化学习(RL)的奖励投毒攻击中,攻击者可在每一步将环境奖励扰动为,以迫使RL智能体学习恶意策略。我们按对的无穷范数约束对此类攻击分类:我们给出一下界,低于该界则奖励投毒攻击不可行且RL被证明安全;我们给出相应上界,高于该界则攻击可行。可行攻击可进一步分为非自适应(其中仅依赖于)或自适应(其中进一步依赖于时刻的RL智能体学习过程)。非自适应攻击是先前工作的焦点。然而,我们证明在温和条件下,自适应攻击可在关于状态空间大小的多项式步数内实现恶意策略,而非自适应攻击需要指数步数。我们给出构造性证明:一种快速自适应攻击策略实现了该多项式速率。最后,我们实证表明攻击者可使用最先进的深度RL技术找到有效的奖励投毒攻击。
引用
@article{arxiv.2003.12613,
title = {Adaptive Reward-Poisoning Attacks against Reinforcement Learning},
author = {Xuezhou Zhang and Yuzhe Ma and Adish Singla and Xiaojin Zhu},
journal= {arXiv preprint arXiv:2003.12613},
year = {2020}
}