中文

具有潜在确定性与条件嵌入的 POMDP 中计算高效的 PAC 强化学习

机器学习 2022-06-27 v1 统计方法学 机器学习

摘要

我们研究具有函数近似的大规模部分可观测马尔可夫决策过程(POMDP)的强化学习,其中状态空间与观测空间很大甚至连续。特别地,我们考虑 POMDP 的希尔伯特空间嵌入,其中潜在状态特征与观测特征满足观测发射过程的条件希尔伯特空间嵌入,且潜在状态转移是确定性的。在函数近似设定下,最优潜在状态-动作 QQ 函数在状态特征上线性,且最优 QQ 函数在动作上具有间隙,我们提供了一种\emph{计算与统计高效}的算法来求取\emph{精确最优}策略。我们表明算法的计算与统计复杂度相对于时域以及观测空间特征的内蕴维数多项式缩放。此外,我们表明确定性潜在转移与间隙假设对于避免随即时域或维数指数增长的统计复杂度是必要的。由于我们的保证不显式依赖于状态与观测空间的大小,我们的算法可证明地扩展到大规模 POMDP。

关键词

引用

@article{arxiv.2206.12081,
  title  = {Computationally Efficient PAC RL in POMDPs with Latent Determinism and Conditional Embeddings},
  author = {Masatoshi Uehara and Ayush Sekhari and Jason D. Lee and Nathan Kallus and Wen Sun},
  journal= {arXiv preprint arXiv:2206.12081},
  year   = {2022}
}