具有时变奖励的大规模马尔可夫决策过程
机器学习
2019-05-28 v1 机器学习
摘要
我们考虑奖励未知且可能以对抗方式变化的马尔可夫决策过程(MDPs)。我们提供了一种算法,其达到了 的最先进后悔界,其中 为状态空间, 为动作空间, 为 MDP 的混合时间, 为周期数。该算法每周期的计算复杂度关于 和 为多项式。我们随后考虑实践中常遇到的一种设定,其中 MDP 的状态空间过大而无法求得精确解。通过使用维度 的线性架构近似状态-动作占据测度,我们提出了一种修正算法,其计算复杂度关于 为多项式。我们也证明了该修正算法的后悔界,据我们所知,这是针对具有时变奖励的大规模 MDP 的第一个 后悔界。
引用
@article{arxiv.1905.10649,
title = {Large Scale Markov Decision Processes with Changing Rewards},
author = {Adrian Rivera Cardoso and He Wang and Huan Xu},
journal= {arXiv preprint arXiv:1905.10649},
year = {2019}
}