中文

具有Bandit反馈与未知转移的对抗式MDP学习

机器学习 2020-11-03 v5 机器学习

摘要

我们考虑在情节式有限时域马尔可夫决策过程中,具有未知转移函数、bandit反馈和对抗损失的学习问题。我们提出了一种高效算法,以高概率实现 O~(LXAT)\mathcal{\tilde{O}}(L|X|\sqrt{|A|T}) 的遗憾值,其中 LL 为时域长度,X|X| 为状态数,A|A| 为动作数,TT 为情节数。据我们所知,我们的算法是首个在该具有挑战性的设定下保证 O~(T)\mathcal{\tilde{O}}(\sqrt{T}) 遗憾值的算法;事实上,它达到了与 (Rosenberg & Mansour, 2019a) 相同的遗憾界,而后者考虑的是具有全信息反馈的更简单设定。我们的关键技术贡献有两点:更紧的转移函数置信集,以及由 上占用界\textit{上占用界} 逆加权的最优损失估计器。

关键词

引用

@article{arxiv.1912.01192,
  title  = {Learning Adversarial MDPs with Bandit Feedback and Unknown Transition},
  author = {Chi Jin and Tiancheng Jin and Haipeng Luo and Suvrit Sra and Tiancheng Yu},
  journal= {arXiv preprint arXiv:1912.01192},
  year   = {2020}
}

备注

Fix a bug