在线深度强化学习的高效奖励投毒攻击
机器学习
2023-07-18 v3 密码学与安全
摘要
我们研究了在线深度强化学习(DRL)中的奖励投毒攻击,其中攻击者对智能体所使用的学习算法以及环境动态均不知情。通过设计一个称为对抗式 MDP 攻击的通用黑盒奖励投毒框架,我们展示了最先进 DRL 算法的内在脆弱性。我们实例化该框架以构造两种新攻击,它们仅破坏总训练时间步中很小一部分的奖励,并使智能体学习到性能低下的策略。我们对攻击的效率提供了理论分析,并进行了广泛的实证评估。我们的结果表明,我们的攻击能高效地对在若干流行经典控制与 MuJoCo 环境中使用多种最先进 DRL 算法(如 DQN、PPO、SAC 等)学习的智能体进行投毒。
引用
@article{arxiv.2205.14842,
title = {Efficient Reward Poisoning Attacks on Online Deep Reinforcement Learning},
author = {Yinglun Xu and Qi Zeng and Gagandeep Singh},
journal= {arXiv preprint arXiv:2205.14842},
year = {2023}
}
备注
Accepted by TMLR