中文

在已知转移下同时学习随机与对抗性片段式MDP

机器学习 2020-11-03 v2 机器学习

摘要

本文研究具有已知转移和bandit反馈的片段式马尔可夫决策过程的学习问题。我们开发了首个具有“两全其美”保证的算法:当损失为随机时实现O(logT)\mathcal{O}(log T)后悔,同时即使在损失为对抗性时也以O~(T)\tilde{\mathcal{O}}(\sqrt{T})后悔享有最坏情形鲁棒性,其中TT为片段数。更一般地,在损失被总量为CC的扰动破坏的中间设定下,它实现O~(C)\tilde{\mathcal{O}}(\sqrt{C})后悔。我们的算法基于Zimin和Neu (2013)的Follow-the-Regularized-Leader方法,并受Zimmert等人(2019a, 2019b)针对多臂bandit特例的近期工作启发,采用了一种新颖的混合正则化器。关键在于,我们的正则化器具有非对角Hessian且逆矩阵极为复杂。分析此类正则化器并推导特定的自界后悔保证是我们的关键技术贡献,可能具有独立意义。

关键词

引用

@article{arxiv.2006.05606,
  title  = {Simultaneously Learning Stochastic and Adversarial Episodic MDPs with Known Transition},
  author = {Tiancheng Jin and Haipeng Luo},
  journal= {arXiv preprint arXiv:2006.05606},
  year   = {2020}
}

备注

Update the camera-ready version for NeurIPS 2020