分布鲁棒异动态强化学习的上下界
机器学习
2024-10-01 v1 人工智能
机器学习
摘要
我们研究异动态强化学习,其中策略训练和部署环境不同。为了应对这种环境扰动,我们专注于在分布鲁棒马尔可夫决策过程的框架下学习对转移动力学不确定性具有鲁棒性的策略,其中名义和扰动动力学是线性马尔可夫决策过程。我们提出了一种新颖的算法We-DRIVE-U,其平均次优性为~O(d H * min{1/ρ, H}/√K),其中K是回合数,H是视界长度,d是特征维度,ρ是不确定性水平。该结果比现有最优结果提升了O(dH/min{1/ρ,H})。我们还构建了一个新颖的困难实例,并推导了该设置下的第一个信息论下界,这表明我们的算法对于任何不确定性水平ρ∈(0,1]都是接近最优的,差距为O(√H)。我们的算法还具有“罕见切换”设计,因此仅需要O(dH log(1+H^2K))次策略切换和O(d^2H log(1+H^2K))次调用oracle来解决对偶优化问题,这显著提高了现有DRMDP算法的计算效率,后者的策略切换和oracle复杂度均为O(K)。
引用
@article{arxiv.2409.20521,
title = {Upper and Lower Bounds for Distributionally Robust Off-Dynamics Reinforcement Learning},
author = {Zhishuai Liu and Weixin Wang and Pan Xu},
journal= {arXiv preprint arXiv:2409.20521},
year = {2024}
}
备注
48 pages, 3 figures, 2 tables