中文

光滑 MDP 中的无遗憾强化学习

机器学习 2024-02-07 v1 人工智能

摘要

在具有连续状态和/或动作空间的问题中获得强化学习(RL)的无遗憾保证仍然是该领域的主要开放挑战之一。最近,人们提出了各种解决方案,但除了非常特定的设置外,一般问题仍未解决。在本文中,我们引入了马尔可夫决策过程(MDPs)的一种新颖结构假设,即 ν\nu-光滑性,它概括了迄今为止提出的大多数设置(例如线性 MDP 和 Lipschitz MDP)。为了应对这一具有挑战性的场景,我们提出了两种用于 ν\nu-光滑 MDP 中遗憾最小化的算法。这两种算法都基于通过基于 Legendre 多项式的正交特征映射构建 MDP 表示的思想。第一种算法 \textsc{Legendre-Eleanor} 在较弱的假设下实现了无遗憾性质,但计算效率低下;而第二种算法 \textsc{Legendre-LSVI} 虽然适用于较小类别的问题,但能在多项式时间内运行。在分析它们的遗憾性质后,我们将我们的结果与 RL 理论中的最先进结果进行了比较,表明我们的算法实现了最佳的保证。

关键词

引用

@article{arxiv.2402.03792,
  title  = {No-Regret Reinforcement Learning in Smooth MDPs},
  author = {Davide Maran and Alberto Maria Metelli and Matteo Papini and Marcello Restell},
  journal= {arXiv preprint arXiv:2402.03792},
  year   = {2024}
}