同时使用离线与在线数据的无模型鲁棒 $\phi$-散度强化学习
机器学习
2024-05-10 v1 机器学习
摘要
鲁棒 -正则化马尔可夫决策过程(RRMDP)框架侧重于设计针对因模拟器(标称)模型与现实世界设置之间不匹配导致的参数不确定性具有鲁棒性的控制策略。这项工作做出了两项重要贡献。首先,我们提出了一种名为鲁棒 -正则化拟合 Q 迭代(RPQ)的无模型算法,用于学习 -最优鲁棒策略,该算法仅使用在标称模型上通过展开行为策略(具有鲁棒探索性要求)收集的历史数据。据我们所知,我们为在高维系统中使用一般函数逼近实现鲁棒最优策略的一类 -散度提供了首个统一分析。其次,我们引入了混合鲁棒 -正则化强化学习框架,以利用历史数据和在线采样来学习最优鲁棒策略。针对该框架,我们提出了一种名为混合鲁棒全变差正则化 Q 迭代(HyTQ:读作 height-Q)的无模型算法。据我们所知,我们在具有一般函数逼近的大规模问题中,在混合鲁棒 -正则化强化学习框架下,提供了首个改进的分布外数据假设。最后,我们对算法在任意大状态空间系统上学到的策略性能提供了理论保证。
引用
@article{arxiv.2405.05468,
title = {Model-Free Robust $\phi$-Divergence Reinforcement Learning Using Both Offline and Online Data},
author = {Kishan Panaganti and Adam Wierman and Eric Mazumdar},
journal= {arXiv preprint arXiv:2405.05468},
year = {2024}
}
备注
To appear in the proceedings of the International Conference on Machine Learning (ICML) 2024