具有连续动作空间的低秩马尔可夫决策过程
机器学习
2024-04-03 v2 人工智能
机器学习
摘要
低秩马尔可夫决策过程(MDPs)近期已成为强化学习(RL)领域中一个有前景的框架,因为它们在结合用于表示学习的 ML 算法的同时,可提供可证明近似正确(PAC)的学习保证。然而,现有的低秩 MDP 方法存在局限:它们仅考虑有限动作空间,并在 时给出空泛的界,这极大限制了其适用性。本工作中,我们研究将此类方法扩展到连续动作设置的问题,并探索了多种实现该扩展的具体途径。作为一个案例研究,我们考虑开创性的 FLAMBE 算法(Agarwal 等,2020),这是一种用于低秩 MDP 的奖励无关 PAC RL 方法。我们表明,在不对算法做任何修改的情况下,当动作允许连续时,我们获得了类似的 PAC 界。具体而言,当转移函数的模型关于动作满足 H"older 平滑条件,且策略类具有一致有界的最小密度或奖励函数同样为 H"older 平滑时,我们获得了一个依赖于平滑阶数的多项式 PAC 界。
引用
@article{arxiv.2311.03564,
title = {Low-Rank MDPs with Continuous Action Spaces},
author = {Andrew Bennett and Nathan Kallus and Miruna Oprescu},
journal= {arXiv preprint arXiv:2311.03564},
year = {2024}
}
备注
25 pages, AISTATS 2024