具有Bandit反馈与未知转移的对抗式MDP学习
机器学习
2020-11-03 v5 机器学习
摘要
我们考虑在情节式有限时域马尔可夫决策过程中,具有未知转移函数、bandit反馈和对抗损失的学习问题。我们提出了一种高效算法,以高概率实现 的遗憾值,其中 为时域长度, 为状态数, 为动作数, 为情节数。据我们所知,我们的算法是首个在该具有挑战性的设定下保证 遗憾值的算法;事实上,它达到了与 (Rosenberg & Mansour, 2019a) 相同的遗憾界,而后者考虑的是具有全信息反馈的更简单设定。我们的关键技术贡献有两点:更紧的转移函数置信集,以及由 逆加权的最优损失估计器。
引用
@article{arxiv.1912.01192,
title = {Learning Adversarial MDPs with Bandit Feedback and Unknown Transition},
author = {Chi Jin and Tiancheng Jin and Haipeng Luo and Suvrit Sra and Tiancheng Yu},
journal= {arXiv preprint arXiv:1912.01192},
year = {2020}
}
备注
Fix a bug