具有线性值函数的因子状态 MDP 中的多项式时间强化学习
机器学习
2022-03-08 v2
摘要
实践中许多强化学习(RL)环境具有庞大的状态空间,这些状态空间可通过“因子化”结构紧凑地描述,并可由因子马尔可夫决策过程(FMDPs)建模。我们提出了首个用于因子状态 MDP(FMDPs 的推广)中 RL 的多项式时间算法,该算法既不依赖预言规划器,也不要求线性转移模型;它仅需要一个相对于因子化具有合适局部基的线性值函数,从而允许高效的变量消去。在此假设下,我们可以通过为凸优化构造高效的分离预言机,在多项式时间内求解该类因子状态 MDP。重要的是,与先前关于 FMDPs 的工作不同,我们不假设各因子上的转移条件独立。
引用
@article{arxiv.2107.05187,
title = {Polynomial Time Reinforcement Learning in Factored State MDPs with Linear Value Functions},
author = {Zihao Deng and Siddartha Devic and Brendan Juba},
journal= {arXiv preprint arXiv:2107.05187},
year = {2022}
}
备注
29 pages, 1 figure