中文

线性马尔可夫决策过程中的常数报酬

机器学习 2024-12-13 v2

摘要

我们研究线性马尔可夫决策过程 (MDP) 中的常数报酬保证。在强化学习 (RL) 中,我们的目标是设计一种在无限剂集内以高概率只产生有限报酬的算法。我们引入一种算法 Cert-LSVI-UCB,用于处理模型化的线性马尔可夫决策过程,其中转换核和奖励函数都可以以误差水平 ζ\zeta 近似为线性函数。在 Cert-LSVI-UCB 的核心是一种创新的方法,使我们能够对多阶段价值目标回归进行细粒度的浓度分析,从而建立与剂集数相关的实例依赖报酬界。具体而言,我们表明对于由最小次优间隙 Δ\Delta 特征的线性 MDP,Cert-LSVI-UCB 在高概率下具有累积报酬 O~(d3H5/Δ)\tilde{\mathcal{O}}(d^3H^5/\Delta),前提是模型化误差水平 ζ\zeta 小于 O~(Δ/(dH2))\tilde{\mathcal{O}}(\Delta / (\sqrt{d}H^2))。此处 dd 为特征空间维数,HH 为时域 horizon。值得注意的是,这一报酬界与剂集数 KK 无关。据我们所知,Cert-LSVI-UCB 是首个在不依赖先验分布假设的情况下,实现线性函数逼近 RL 中常数、实例依赖、高概率报酬界的算法。

关键词

引用

@article{arxiv.2404.10745,
  title  = {Achieving Constant Regret in Linear Markov Decision Processes},
  author = {Weitong Zhang and Zhiyuan Fan and Jiafan He and Quanquan Gu},
  journal= {arXiv preprint arXiv:2404.10745},
  year   = {2024}
}

备注

45 pages, 3 tables, 2 figures, in 38th Conference on Neural Information Processing Systems (NeurIPS 2024)