中文

基于线性MDP的离线约束强化学习原始-对偶算法

机器学习 2024-06-04 v2 机器学习

摘要

我们研究无限视界折扣设定下的线性MDP离线强化学习(RL),旨在利用预收集的数据集学习一个最大化期望折扣累积奖励的策略。针对此设定的现有算法要么需要均匀数据覆盖假设,要么在以 O(ϵ2)O(\epsilon^{-2}) 样本复杂度寻找 ϵ\epsilon-最优策略时计算效率低下。在本文中,我们提出了一种用于无限视界折扣设定下线性MDP离线强化学习的原始-对偶算法。我们的算法是该设定下首个在部分数据覆盖假设下实现 O(ϵ2)O(\epsilon^{-2}) 样本复杂度且计算高效的算法。我们的工作是对近期一项需要 O(ϵ4)O(\epsilon^{-4}) 样本的研究的改进。此外,我们将算法扩展到离线约束强化学习设定中,以对额外奖励信号施加约束。

关键词

引用

@article{arxiv.2402.04493,
  title  = {A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs},
  author = {Kihyuk Hong and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2402.04493},
  year   = {2024}
}