中文

具有对抗性奖励和_bandit_反馈的确定性 MDP

人工智能 2012-10-19 v1 统计方法学

摘要

我们考虑一种马尔可夫决策过程(MDP),其具有确定性的状态转移动态、每轮任意变化的对抗性生成奖励,以及决策者仅能观测到其所获奖励的_bandit_反馈模型。在此设定下,我们提出了一种名为 MarcoPolo 的新型高效在线决策算法。在关于转移动态结构的温和假设下,我们证明 MarcoPolo 相对于事后最优确定性策略的遗憾界为 O(T^(3/4)sqrt(log(T)))。具体而言,我们的分析不依赖于此前该领域大部分工作所主导的严格单链(unichain)假设。

关键词

引用

@article{arxiv.1210.4842,
  title  = {Causal Inference by Surrogate Experiments: z-Identifiability},
  author = {Elias Bareinboim and Judea Pearl},
  journal= {arXiv preprint arXiv:1210.4842},
  year   = {2012}
}

备注

Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)