基于线性MDP的离线约束强化学习原始-对偶算法
机器学习
2024-06-04 v2 机器学习
摘要
我们研究无限视界折扣设定下的线性MDP离线强化学习(RL),旨在利用预收集的数据集学习一个最大化期望折扣累积奖励的策略。针对此设定的现有算法要么需要均匀数据覆盖假设,要么在以 样本复杂度寻找 -最优策略时计算效率低下。在本文中,我们提出了一种用于无限视界折扣设定下线性MDP离线强化学习的原始-对偶算法。我们的算法是该设定下首个在部分数据覆盖假设下实现 样本复杂度且计算高效的算法。我们的工作是对近期一项需要 样本的研究的改进。此外,我们将算法扩展到离线约束强化学习设定中,以对额外奖励信号施加约束。
引用
@article{arxiv.2402.04493,
title = {A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs},
author = {Kihyuk Hong and Ambuj Tewari},
journal= {arXiv preprint arXiv:2402.04493},
year = {2024}
}