基于对抗攻击的鲁棒深度强化学习
机器学习
2017-12-12 v1 人工智能
机器人学
摘要
本文针对强化学习(RL)提出对抗攻击,并借助这些攻击提升了深度强化学习算法(DRL)对参数不确定性的鲁棒性。我们表明,即使是朴素设计的攻击也能成功降低 DRL 算法的性能。我们进一步利用所设计损失函数的梯度信息改进攻击,导致性能进一步下降。随后在训练过程中利用这些攻击,在鲁棒控制框架下提升 RL 的鲁棒性。我们表明,对 Deep Double Q learning 和 Deep Deterministic Policy Gradients 等 DRL 算法进行此种对抗训练,可显著提升其在 Cart-pole、Mountain Car、Hopper 和 Half Cheetah 等 RL 基准环境中的参数变化鲁棒性。
引用
@article{arxiv.1712.03632,
title = {Robust Deep Reinforcement Learning with Adversarial Attacks},
author = {Anay Pattanaik and Zhenyi Tang and Shuijing Liu and Gautham Bommannan and Girish Chowdhary},
journal= {arXiv preprint arXiv:1712.03632},
year = {2017}
}