具有模型不确定性的在线鲁棒强化学习
机器学习
2021-10-29 v2
摘要
鲁棒强化学习(RL)旨在寻找一种策略,该策略在最坏情形下对一组MDP(马尔可夫决策过程)的不确定性集合上的性能进行优化。本文关注无模型鲁棒RL,其中不确定性集合以某个被错误指定的MDP为中心,该MDP顺序生成单条样本轨迹且假定未知。我们开发了一种基于样本的方法来估计未知的不确定性集合,并设计了鲁棒Q学习算法(表格情形)和鲁棒TDC算法(函数逼近设定),它们可以以在线和增量的方式实现。对于鲁棒Q学习算法,我们证明其收敛到最优鲁棒Q函数;对于鲁棒TDC算法,我们证明其渐近收敛到某些驻点。与[Roy et al., 2017]中的结果不同,我们的算法不需要对折扣因子施加任何额外条件来保证收敛。我们进一步刻画了两种算法的有限时间误差界,并表明鲁棒Q学习和鲁棒TDC算法的收敛速度与其原始对应算法相当(在一个常数因子内)。我们的数值实验进一步证明了我们算法的鲁棒性。我们的方法可以容易地扩展以鲁棒化许多其他算法,例如TD、SARSA以及其他GTD算法。
引用
@article{arxiv.2109.14523,
title = {Online Robust Reinforcement Learning with Model Uncertainty},
author = {Yue Wang and Shaofeng Zou},
journal= {arXiv preprint arXiv:2109.14523},
year = {2021}
}
备注
Accepted by NeurIPS 2021