中文

在线马尔可夫决策过程的动态遗憾

机器学习 2022-08-29 v1 机器学习

摘要

我们研究具有对抗性变化损失函数和已知转移的在线马尔可夫决策过程(MDPs)。我们选取动态遗憾作为性能度量,定义为学习器与任意序列的可行变化策略之间的性能差异。该度量严格强于以固定比较策略基准化学习器性能的标准静态遗憾。我们考虑三种基础的在线 MDP 模型,包括情节式无环随机最短路径(SSP)、情节式 SSP 和无限视野 MDP。对于这三种模型,我们分别提出了新颖的在线集成算法并建立了它们的动态遗憾保证,其中情节式(无环)SSP 的结果关于时间视野和某种非平稳性度量在极小极大意义下是最优的。此外,当学习器遇到的在线环境可预测时,我们设计了改进算法,对情节式(无环)SSP 实现了更好的动态遗憾界;并且,我们给出了无限视野 MDP 的不可能性结果。

关键词

引用

@article{arxiv.2208.12483,
  title  = {Dynamic Regret of Online Markov Decision Processes},
  author = {Peng Zhao and Long-Fei Li and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2208.12483},
  year   = {2022}
}