中文

两全其美:具有未知转移的随机与对抗性情景式 MDP

机器学习 2021-10-19 v2

摘要

我们考虑通过 TT 个情景学习情景式马尔可夫决策过程的最佳兼得问题,目标是在损失为对抗性时实现 O~(T)\widetilde{\mathcal{O}}(\sqrt{T}) 遗憾,同时在损失为(近似)随机时实现 O(polylog(T))\mathcal{O}(\text{polylog}(T)) 遗憾。[Jin and Luo, 2020] 近期的工作在固定转移已知的情况下实现了这一目标,并将未知转移的情况留作一个主要的开放问题。在本工作中,我们使用相同的跟随正则化领导者(FTRL\text{FTRL})框架以及一组新技术解决了这一开放问题。具体而言,我们首先在 FTRL\text{FTRL} 分析中提出一种损失偏移技巧,极大地简化了 [Jin and Luo, 2020] 的方法,并已改进了他们在已知转移情形下的结果。然后,我们将该思想推广到未知转移情形,并提出了一种新颖的分析,在随机设定下将转移估计误差由上界(一部分)遗憾本身所界定,这是确保 O(polylog(T))\mathcal{O}(\text{polylog}(T)) 遗憾的关键性质。

关键词

引用

@article{arxiv.2106.04117,
  title  = {The best of both worlds: stochastic and adversarial episodic MDPs with unknown transition},
  author = {Tiancheng Jin and Longbo Huang and Haipeng Luo},
  journal= {arXiv preprint arXiv:2106.04117},
  year   = {2021}
}

备注

The camera-ready version for NeurIPS 2021