组合因果_bandit问题
机器学习
2022-12-21 v5 社会与信息网络
统计方法学
机器学习
摘要
在组合因果_bandit(CCB)中,学习智能体每轮至多选择 个变量进行干预,从观测变量收集反馈,目标是最小化目标变量 上的期望后悔。我们在二元广义线性模型(BGLM)且具有简洁参数化因果模型表示的背景下进行研究。我们基于最大似然估计方法提出针对马尔可夫BGLM(即无隐变量)的BGLM-OFU算法,并证明其达到 的后悔界,其中 为时间范围。对于含隐变量的线性模型这一特例,我们应用do-calculus等因果推断技术将原始模型转化为马尔可夫模型,进而表明我们的BGLM-OFU算法与另一种基于线性回归的算法均可求解此类含隐变量的线性模型。我们的创新包括:(a)考虑组合干预动作空间及含隐变量的一般因果模型;(b)整合并改编广义线性_bandit与在线影响最大化等多样研究中的技术;(c)避免了先前研究中不现实的假设(如已知所有干预下 的父节点的联合分布)以及关于因果图大小呈指数级的后悔因子。
引用
@article{arxiv.2206.01995,
title = {Combinatorial Causal Bandits},
author = {Shi Feng and Wei Chen},
journal= {arXiv preprint arXiv:2206.01995},
year = {2022}
}
备注
30 pages, 9 figures