中文

面向预测状态表示的PAC强化学习

机器学习 2022-08-16 v3

摘要

本文研究部分可观测动力系统中的在线强化学习(RL)。我们关注预测状态表示(PSR)模型,这是一种富有表达力的模型,涵盖了部分可观测马尔可夫决策过程(POMDP)等其他知名模型。PSR使用一组对未来观测的预测来表示状态,并完全由可观测量定义。我们为PSR开发了一种新颖的基于模型的算法,该算法能以关于系统所有相关参数多项式规模的样本复杂度学习近最优策略。我们的算法天然可与函数逼近结合,以扩展到具有潜在大状态和观测空间的系统。我们证明,给定可实现的模型类,学习近最优策略的样本复杂度仅随模型类的统计复杂度多项式缩放,而不显式多项式依赖于状态和观测空间的大小。值得注意的是,我们的工作是首个展示在PSR中与全局最优策略竞争具有多项式样本复杂度的工作。最后,我们展示了如何将我们的通用定理直接用于推导特殊模型的样本复杂度界,包括mm步弱揭示与mm步可解码表格POMDP、具有低秩潜在转移的POMDP,以及具有线性发射与潜在转移的POMDP。

关键词

引用

@article{arxiv.2207.05738,
  title  = {PAC Reinforcement Learning for Predictive State Representations},
  author = {Wenhao Zhan and Masatoshi Uehara and Wen Sun and Jason D. Lee},
  journal= {arXiv preprint arXiv:2207.05738},
  year   = {2022}
}