中文

对抗式马尔可夫决策过程中 FPL 的精细化分析

机器学习 2020-08-24 v1 机器学习

摘要

我们考虑对抗式马尔可夫决策过程(MDP)问题,其中 MDP 的奖励可被对抗式选取,且转移函数可为已知或未知。在这两种设定下,已有文献提出了基于跟随扰动领导者(FPL)的算法。然而,已建立的基于 FPL 算法的后悔界劣于基于镜像下降的算法。我们改进了两种设定下基于 FPL 算法的分析,以更快且更简单的算法匹配当前最优后悔界。

关键词

引用

@article{arxiv.2008.09251,
  title  = {Refined Analysis of FPL for Adversarial Markov Decision Processes},
  author = {Yuanhao Wang and Kefan Dong},
  journal= {arXiv preprint arXiv:2008.09251},
  year   = {2020}
}

备注

11 pages