中文

因果马尔可夫决策过程:高效学习良好干预

机器学习 2021-02-16 v1 机器学习

摘要

我们引入了因果马尔可夫决策过程(C-MDPs),这是一种新的序贯决策形式化框架,它将标准 MDP 公式与状态和奖励函数上的因果结构相结合。由于干预与状态/奖励之间关系背后的因果机制,许多当代和新兴应用领域(如数字医疗和数字营销)可受益于 C-MDPs 的建模。我们提出了因果上置信界值迭代(C-UCBVI)算法,该算法利用 C-MDPs 中的因果结构,并改进了未考虑因果知识的标准强化学习算法的性能。我们证明 C-UCBVI 满足 O~(HSZT)\tilde{O}(HS\sqrt{ZT}) 后悔界,其中 TT 为总时间步数,HH 为片段长度,SS 为状态空间基数。值得注意的是,我们的后悔界不随动作/干预的数量(AA)增长,而仅随因果图相关量 ZZ 增长,该量可指数级小于 AA。通过将 C-UCBVI 扩展到分解 MDP 设定,我们提出了因果分解 UCBVI(CF-UCBVI)算法,该算法进一步在 SS 意义上将后悔指数级降低。此外,我们表明线性 MDP 问题的 RL 算法也可纳入 C-MDPs。我们通过实验在各种设定下展示了我们因果方法的优势,以验证我们的算法和理论结果。

关键词

引用

@article{arxiv.2102.07663,
  title  = {Causal Markov Decision Processes: Learning Good Interventions Efficiently},
  author = {Yangyi Lu and Amirhossein Meisami and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2102.07663},
  year   = {2021}
}