中文

面向线性结构方程模型的因果 Bandit

机器学习 2023-04-04 v3 机器学习

摘要

本文研究在因果图模型中设计最优干预序列以最小化相对于事后最优干预的累积后悔的问题。这自然地被表述为一个因果 bandit 问题。重点在于面向线性结构方程模型(SEMs)和软干预的因果 bandit。假设图结构已知且具有 N 个节点。对每个节点假设两种线性机制,一种软干预和一种观测,从而产生 2^N 种可能的干预。现有多数因果 bandit 算法假设至少奖励节点父节点的干预分布被完全指定。然而,这样的分布有 2^N 个(每个干预对应一个),获取它们在中等规模图中也变得不可行。本文摒弃了已知这些分布或其边缘分布的假设。针对频率主义(基于 UCB)和贝叶斯(基于 Thompson Sampling)设定提出了两种算法。这些算法的关键思想是直接避免估计 2^N 个奖励分布,而是估计完全指定 SEMs 的参数(关于 N 线性)并用其计算奖励。在两种算法中,于噪声和参数空间的有界性假设下,累积后悔的尺度为 \tilde{\cal O} (d^{L+\frac{1}{2}} \sqrt{NT}),其中 d 为图的最大度,L 为其最长因果路径的长度。此外,给出了 Ω(d^{\frac{L}{2}-2}\sqrt{T}) 的极小极大下界,这表明可达界与下界在关于时域 T 以及图参数 d 和 L 的尺度行为上是一致的。

关键词

引用

@article{arxiv.2208.12764,
  title  = {Causal Bandits for Linear Structural Equation Models},
  author = {Burak Varici and Karthikeyan Shanmugam and Prasanna Sattigeri and Ali Tajer},
  journal= {arXiv preprint arXiv:2208.12764},
  year   = {2023}
}

备注

61 pages; new to this version: added lower bounds and relaxed assumptions