连续控制任务中基于不确定性集正则化的鲁棒强化学习
机器学习
2023-12-06 v4 人工智能
系统与控制
系统与控制
摘要
强化学习(RL)被认为在环境扰动下缺乏泛化性与鲁棒性,这极大限制了其在真实世界机器人中的应用。先前工作声称,对值函数添加正则化等价于学习具有不确定转移的鲁棒策略。尽管正则化-鲁棒性转换因其简洁高效而颇具吸引力,在连续控制任务中仍属欠缺。本文提出名为ncertainty et egularizer(USR,不确定性集正则化器)的新正则化器,通过在转移函数的参数空间上构造不确定性集实现。特别地,USR具有足够灵活性,可插入任意现有RL框架。为处理未知不确定性集,我们进一步提出一种基于值函数的对抗式新方法以生成它们。我们在真实世界强化学习(RWRL)基准上评估USR,证明了其在受扰动测试环境中的鲁棒性能提升。
引用
@article{arxiv.2207.02016,
title = {Robust Reinforcement Learning in Continuous Control Tasks with Uncertainty Set Regularization},
author = {Yuan Zhang and Jianhong Wang and Joschka Boedecker},
journal= {arXiv preprint arXiv:2207.02016},
year = {2023}
}
备注
Accepted at CoRL 2023