中文

有预算与无预算的因果多臂老虎机

机器学习 2020-12-15 v1 机器学习

摘要

在因果图中学习良好干预可建模为带有边信息的随机多臂老虎机问题。首先,我们研究当干预比观测更昂贵且指定了预算时的该问题。若从可干预节点到奖励节点不存在后门路径,则我们提出一种最小化简单遗憾的算法,该算法基于干预代价最优地权衡观测与干预。我们还提出一种考虑干预代价、利用因果边信息并在不超出预算的情况下最小化期望累积遗憾的算法。我们的累积遗憾最小化算法表现优于未考虑边信息的标准算法。最后,我们研究一般图中无预算约束下学习最佳干预的问题,并给出一种算法,当每次干预的奖励变量父分布已知时,其期望累积遗憾在实例参数意义下为常数。我们的结果经过实验验证,并与当前文献中已知最佳界进行比较。

关键词

引用

@article{arxiv.2012.07058,
  title  = {Budgeted and Non-budgeted Causal Bandits},
  author = {Vineet Nair and Vishakha Patil and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2012.07058},
  year   = {2020}
}