因果马尔可夫决策过程:高效学习良好干预
机器学习
2021-02-16 v1 机器学习
摘要
我们引入了因果马尔可夫决策过程(C-MDPs),这是一种新的序贯决策形式化框架,它将标准 MDP 公式与状态和奖励函数上的因果结构相结合。由于干预与状态/奖励之间关系背后的因果机制,许多当代和新兴应用领域(如数字医疗和数字营销)可受益于 C-MDPs 的建模。我们提出了因果上置信界值迭代(C-UCBVI)算法,该算法利用 C-MDPs 中的因果结构,并改进了未考虑因果知识的标准强化学习算法的性能。我们证明 C-UCBVI 满足 后悔界,其中 为总时间步数, 为片段长度, 为状态空间基数。值得注意的是,我们的后悔界不随动作/干预的数量()增长,而仅随因果图相关量 增长,该量可指数级小于 。通过将 C-UCBVI 扩展到分解 MDP 设定,我们提出了因果分解 UCBVI(CF-UCBVI)算法,该算法进一步在 意义上将后悔指数级降低。此外,我们表明线性 MDP 问题的 RL 算法也可纳入 C-MDPs。我们通过实验在各种设定下展示了我们因果方法的优势,以验证我们的算法和理论结果。
引用
@article{arxiv.2102.07663,
title = {Causal Markov Decision Processes: Learning Good Interventions Efficiently},
author = {Yangyi Lu and Amirhossein Meisami and Ambuj Tewari},
journal= {arXiv preprint arXiv:2102.07663},
year = {2021}
}