因果_bandit的组合纯探索
机器学习
2023-03-15 v3 人工智能
摘要
因果bandit的组合纯探索是如下在线学习任务:给定一个具有未知因果推断分布的因果图,在每轮中我们选择一组变量进行干预或不干预,并观察所有随机变量的随机结果,目标是使用尽可能少的轮数,以至少1−δ的概率输出一个在奖励变量上给出最佳(或近乎最佳)期望结果的干预,其中δ为给定的置信水平。我们在两类因果模型——二元广义线性模型(BGLM)和一般图——上提供了首个依赖于间隙且完全自适应的纯探索算法。对于BGLM,我们的算法是首个专门为该设置设计的,并实现了多项式样本复杂度,而现有一般图算法要么样本复杂度对图大小呈指数,要么带有某些不合理假设。对于一般图,我们的算法在样本复杂度上提供了显著改进,并且几乎匹配我们证明的下界。我们的算法通过将先前的因果bandit算法与先前的自适应纯探索算法新颖地结合而实现此种改进,前者利用了因果bandit中丰富的观测反馈但不适应奖励间隙,而后者则存在相反的问题。
引用
@article{arxiv.2206.07883,
title = {Combinatorial Pure Exploration of Causal Bandits},
author = {Nuoya Xiong and Wei Chen},
journal= {arXiv preprint arXiv:2206.07883},
year = {2023}
}