中文

两阶段因果 MDP 的干预高效算法

机器学习 2021-11-02 v1 人工智能

摘要

我们研究马尔可夫决策过程(MDP),其中状态对应于随机生成奖励的因果图。在此设定下,学习者的目标是通过在每个状态上对变量进行干预,识别能带来高奖励的原子干预。在推广近期因果-bandit框架的基础上,本文针对每个状态具有并行因果图的两阶段因果 MDP 给出了(简单)后悔最小化的保证。我们提出了一种达到实例相关后悔界的算法。我们算法的一个关键特征是利用凸优化来解决探索问题。我们识别出若干实例类,其中我们的后悔保证本质上是紧的,并通过实验验证了我们的理论结果。

关键词

引用

@article{arxiv.2111.00886,
  title  = {Intervention Efficient Algorithm for Two-Stage Causal MDPs},
  author = {Rahul Madhavan and Aurghya Maiti and Gaurav Sinha and Siddharth Barman},
  journal= {arXiv preprint arXiv:2111.00886},
  year   = {2021}
}

备注

29 pages