两全其美:具有未知转移的随机与对抗性情景式 MDP
机器学习
2021-10-19 v2
摘要
我们考虑通过 个情景学习情景式马尔可夫决策过程的最佳兼得问题,目标是在损失为对抗性时实现 遗憾,同时在损失为(近似)随机时实现 遗憾。[Jin and Luo, 2020] 近期的工作在固定转移已知的情况下实现了这一目标,并将未知转移的情况留作一个主要的开放问题。在本工作中,我们使用相同的跟随正则化领导者()框架以及一组新技术解决了这一开放问题。具体而言,我们首先在 分析中提出一种损失偏移技巧,极大地简化了 [Jin and Luo, 2020] 的方法,并已改进了他们在已知转移情形下的结果。然后,我们将该思想推广到未知转移情形,并提出了一种新颖的分析,在随机设定下将转移估计误差由上界(一部分)遗憾本身所界定,这是确保 遗憾的关键性质。
引用
@article{arxiv.2106.04117,
title = {The best of both worlds: stochastic and adversarial episodic MDPs with unknown transition},
author = {Tiancheng Jin and Longbo Huang and Haipeng Luo},
journal= {arXiv preprint arXiv:2106.04117},
year = {2021}
}
备注
The camera-ready version for NeurIPS 2021