利用 $\mathcal{L}_1$ 自适应控制增强强化学习策略的鲁棒性
机器学习
2022-03-10 v5 系统与控制
系统与控制
摘要
在标称环境中训练的强化学习(RL)策略可能因动态变化而在新环境或受扰动环境中失效。现有鲁棒方法试图通过鲁棒或对抗训练为所有预想动态变化场景获得固定策略。这些方法因强调最坏情况可能导致保守性能,且常涉及对训练环境的繁琐修改。我们提出一种利用 自适应控制增强预训练非鲁棒 RL 策略鲁棒性的方法。借助 控制律快速估计并主动补偿动态变化的能力,我们的方法可显著提升以标准(即非鲁棒)方式训练的 RL 策略的鲁棒性,无论是在模拟器还是真实世界中。数值实验验证了所提方法的有效性。
引用
@article{arxiv.2106.02249,
title = {Robustifying Reinforcement Learning Policies with $\mathcal{L}_1$ Adaptive Control},
author = {Yikun Cheng and Pan Zhao and Manan Gandhi and Bo Li and Evangelos Theodorou and Naira Hovakimyan},
journal= {arXiv preprint arXiv:2106.02249},
year = {2022}
}
备注
A significantly extended version of this paper has been uploaded to arXiv. arXiv:2112.01953