基于 Langevin 动力学对抗训练的高效鲁棒强化学习
机器学习
2020-11-09 v2 机器学习
摘要
我们引入一种采样视角来解决训练鲁棒强化学习(RL)智能体这一挑战性任务。利用强大的随机梯度 Langevin 动力学,我们提出一种新颖、可扩展的双玩家 RL 算法,它是双玩家策略梯度方法的采样变体。在多个 MuJoCo 环境中,我们的算法在不同训练与测试条件下的泛化能力方面持续优于现有基线。我们的实验还表明,即便目标函数完全忽略潜在的环境偏移,与标准 RL 算法相比,我们的采样方法仍高度鲁棒。
引用
@article{arxiv.2002.06063,
title = {Robust Reinforcement Learning via Adversarial training with Langevin Dynamics},
author = {Parameswaran Kamalaruban and Yu-Ting Huang and Ya-Ping Hsieh and Paul Rolland and Cheng Shi and Volkan Cevher},
journal= {arXiv preprint arXiv:2002.06063},
year = {2020}
}