中文

因子化MDP中的强化学习:非片段式设定下的预言机高效算法与更紧 regret 界

机器学习 2020-06-09 v2 机器学习

摘要

我们研究非片段式因子化马尔可夫决策过程(FMDPs)中的强化学习。我们提出了两种针对FMDPs的近最优且预言机高效的算法。假设可访问FMDP规划器,它们分别享有贝叶斯和频率派regret界,二者均退化为标准非因子化MDP的近最优界O~(DSAT)\widetilde{O}(DS\sqrt{AT})。我们提出了一种更紧的连通性度量,即因子化跨度(factored span),用于FMDPs,并证明了依赖于因子化跨度而非直径DD的下界。为缩小下界与上界间的差距,我们提出了REGAL.C算法的改进版本,其regret界依赖于因子化跨度。我们的预言机高效算法在计算机网络管理仿真上优于先前提出的近最优算法。

关键词

引用

@article{arxiv.2002.02302,
  title  = {Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting},
  author = {Ziping Xu and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2002.02302},
  year   = {2020}
}