通过对抗损失实现鲁棒深度强化学习
机器学习
2021-11-12 v2 人工智能
密码学与安全
机器学习
摘要
近期研究表明,深度强化学习智能体易受智能体输入上微小对抗扰动的攻击,这引发了将其部署于现实世界的担忧。为解决此问题,我们提出 RADIAL-RL,一个原则性框架,用于训练对 范数有界对抗攻击具有改进鲁棒性的强化学习智能体。我们的框架与流行的深度强化学习算法兼容,并使用深度 Q 学习、A3C 和 PPO 展示了其性能。我们在三个深度 RL 基准(Atari、MuJoCo 和 ProcGen)上进行了实验,以展示我们鲁棒训练算法的有效性。我们的 RADIAL-RL 智能体在针对不同强度的攻击测试时始终优于先前方法,且训练计算效率更高。此外,我们提出了一种称为贪婪最坏情况奖励(GWC)的新评估方法,用于衡量深度 RL 智能体的攻击不可知鲁棒性。我们表明 GWC 可高效评估,并且是可能最坏对抗攻击序列下奖励的良好估计。我们实验所用的所有代码可在 https://github.com/tuomaso/radial_rl_v2 获取。
引用
@article{arxiv.2008.01976,
title = {Robust Deep Reinforcement Learning through Adversarial Loss},
author = {Tuomas Oikarinen and Wang Zhang and Alexandre Megretski and Luca Daniel and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2008.01976},
year = {2021}
}