基于样本复杂度分析的无模型鲁棒强化学习
机器学习
2024-06-26 v1 人工智能
机器学习
摘要
分布式鲁棒强化学习(DR-RL)旨在建立一个在预定义不确定性集内优化最坏情况性能的策略。尽管进行了广泛的研究,但以往的 DR-RL 算法主要采用基于模型的方法,缺乏具备收敛保证或样本复杂度的无模型方法。本文提出一种基于多层蒙特卡洛(MLMC)技术的无模型 DR-RL 算法来填补这一空白。我们创新性的方法整合了一种阈值机制,确保算法实现的有限样本要求,这是一种 significant 的改进,超越了以往的无模型算法。我们为由总变差、卡方发散和 KL 发散定义的不确定性集开发了算法,并在所有三种情况下提供了有限样本分析。值得注意的是,我们的算法是首个在总变差和卡方发散不确定性集上具有有限样本复杂度的无模型 DR-RL 方法,同时也在样本复杂度和适用性方面优于现有的模型无 DR-RL 算法。我们方法的复杂度为所有三种不确定性模型建立了最紧致的结果,凸显了该算法的有效性和效率,并凸显了其在实际应用中的潜力。
引用
@article{arxiv.2406.17096,
title = {Model-Free Robust Reinforcement Learning with Sample Complexity Analysis},
author = {Yudan Wang and Shaofeng Zou and Yue Wang},
journal= {arXiv preprint arXiv:2406.17096},
year = {2024}
}
备注
UAI 2024