混杂预算约束下的因果赌博机
机器学习
2024-01-17 v1
摘要
我们研究在由底层因果图建模的随机环境中学习“良好”干预的问题。良好干预是指能够最大化奖励的干预。具体而言,我们考虑预先设定预算约束的设置,其中干预可能具有非均匀的成本。我们证明该问题可以形式化为在具有辅助信息的随机多臂赌博机中最大化期望奖励。我们提出一种算法,用于在一般因果图中最小化累积遗憾。该算法根据观测和干预的成本进行权衡,以实现最优奖励。该算法通过允许因果图中存在非均匀成本和隐藏混杂因子,推广了当前最先进的方法。此外,我们开发了一种算法,用于在具有非均匀成本和一般因果图的预算设置中最小化简单遗憾。我们提供了理论保证,包括上界和下界,以及对我们算法的实证评估。我们的实证结果表明,我们的算法优于现有最优方法。
引用
@article{arxiv.2401.07578,
title = {Confounded Budgeted Causal Bandits},
author = {Fateme Jamshidi and Jalal Etesami and Negar Kiyavash},
journal= {arXiv preprint arXiv:2401.07578},
year = {2024}
}