中文

具有时变奖励的大规模马尔可夫决策过程

机器学习 2019-05-28 v1 机器学习

摘要

我们考虑奖励未知且可能以对抗方式变化的马尔可夫决策过程(MDPs)。我们提供了一种算法,其达到了 O(τ(lnS+lnA)Tln(T))O( \sqrt{\tau (\ln|S|+\ln|A|)T}\ln(T)) 的最先进后悔界,其中 SS 为状态空间,AA 为动作空间,τ\tau 为 MDP 的混合时间,TT 为周期数。该算法每周期的计算复杂度关于 S|S|A|A| 为多项式。我们随后考虑实践中常遇到的一种设定,其中 MDP 的状态空间过大而无法求得精确解。通过使用维度 dSd\ll|S| 的线性架构近似状态-动作占据测度,我们提出了一种修正算法,其计算复杂度关于 dd 为多项式。我们也证明了该修正算法的后悔界,据我们所知,这是针对具有时变奖励的大规模 MDP 的第一个 O~(T)\tilde{O}(\sqrt{T}) 后悔界。

关键词

引用

@article{arxiv.1905.10649,
  title  = {Large Scale Markov Decision Processes with Changing Rewards},
  author = {Adrian Rivera Cardoso and He Wang and Huan Xu},
  journal= {arXiv preprint arXiv:1905.10649},
  year   = {2019}
}