MoMA: 基于模型的镜像上升离线强化学习
机器学习
2024-01-23 v1 统计理论
统计方法学
机器学习
统计理论
摘要
基于模型的离线强化学习方法(RL)因其样本效率和泛化能力,在许多决策问题中取得了最先进的性能。尽管取得了这些进展,现有的基于模型的离线RL方法要么侧重于理论研究而未开发实用算法,要么依赖于受限的参数化策略空间,从而未能充分利用基于模型方法固有的非受限策略空间优势。为解决这一局限性,我们开发了MoMA,一种在离线数据部分覆盖下具有一般函数逼近的基于模型的镜像上升算法。MoMA与现有文献的区别在于它采用了非受限策略类。在每次迭代中,MoMA通过在策略评估步骤中对转移模型的置信集内进行最小化过程来保守地估计值函数,然后在策略改进步骤中使用一般函数逼近(而非常用的参数化策略类)更新策略。在一些温和假设下,我们通过证明返回策略的次优性上界,建立了MoMA的理论保证。我们还提供了该算法的一个实际可实现的近似版本。通过数值研究展示了MoMA的有效性。
引用
@article{arxiv.2401.11380,
title = {MoMA: Model-based Mirror Ascent for Offline Reinforcement Learning},
author = {Mao Hong and Zhiyue Zhang and Yue Wu and Yanxun Xu},
journal= {arXiv preprint arXiv:2401.11380},
year = {2024}
}