两阶段因果 MDP 的干预高效算法
机器学习
2021-11-02 v1 人工智能
摘要
我们研究马尔可夫决策过程(MDP),其中状态对应于随机生成奖励的因果图。在此设定下,学习者的目标是通过在每个状态上对变量进行干预,识别能带来高奖励的原子干预。在推广近期因果-bandit框架的基础上,本文针对每个状态具有并行因果图的两阶段因果 MDP 给出了(简单)后悔最小化的保证。我们提出了一种达到实例相关后悔界的算法。我们算法的一个关键特征是利用凸优化来解决探索问题。我们识别出若干实例类,其中我们的后悔保证本质上是紧的,并通过实验验证了我们的理论结果。
引用
@article{arxiv.2111.00886,
title = {Intervention Efficient Algorithm for Two-Stage Causal MDPs},
author = {Rahul Madhavan and Aurghya Maiti and Gaurav Sinha and Siddharth Barman},
journal= {arXiv preprint arXiv:2111.00886},
year = {2021}
}
备注
29 pages