具有通用因果模型与干预的因果老虎机
机器学习
2024-03-04 v1 机器学习
摘要
本文研究了用于因果系统中干预顺序设计的因果老虎机 (CBs)。其目标是通过最小化相对于事后最佳干预序列的累积遗憾度量来优化奖励函数。本文在三个方向上推进了关于 CBs 的结果。首先,假设结构因果模型 (SCMs) 是未知的,并从一般的 Lipschitz 连续函数类 中任意抽取。现有结果通常集中于(广义)线性 SCMs。其次,假设干预为广义软干预,具有任意所需的粒度,从而产生无限数量的可能干预。相比之下,现有文献通常采用原子干预和硬干预。第三,我们提供了关于遗憾的通用上界和下界。上界涵盖(并改进)了特殊情况下的已知界。下界通常是迄今未知的。这些界被表征为以下因素的函数:(i) 图参数,(ii) SCM 空间的 eluder 维数,记为 ,以及 (iii) 函数空间的覆盖数,记为 。具体而言,在时间范围 内可实现的累积遗憾为 ,其中 与 Lipschitz 常数相关, 是图的最大入度, 是最长因果路径的长度。针对特殊类别的 SCMs(神经网络、多项式和线性),进一步细化了上界,并提供了相应的下界。
引用
@article{arxiv.2403.00233,
title = {Causal Bandits with General Causal Models and Interventions},
author = {Zirui Yan and Dennis Wei and Dmitriy Katz-Rogozhnikov and Prasanna Sattigeri and Ali Tajer},
journal= {arXiv preprint arXiv:2403.00233},
year = {2024}
}
备注
37 pages, 13 figures, conference