中文

时序因果多臂老虎机

机器学习 2021-12-06 v1 机器学习

摘要

本文研究多臂老虎机(MAB)问题的一个实例,具体而言是多个因果MAB在同一动力系统中按时间顺序运行的情形。实际上,每个老虎机的奖励分布由相同的非平凡依赖结构所支配,即一个动态因果模型。之所以称为动态,是因为我们允许每个因果MAB依赖于前一个MAB,并由此能够在智能体之间传递信息。我们的贡献,即时序因果老虎机(CCB),适用于因果效应随时间变化且可由同一系统中较早干预提供信息的离散决策场景。本文给出了CCB在一个玩具问题上所展示的一些初步发现。

关键词

引用

@article{arxiv.2112.01819,
  title  = {Chronological Causal Bandits},
  author = {Neil Dhir},
  journal= {arXiv preprint arXiv:2112.01819},
  year   = {2021}
}

备注

10 pages, accepted at the NeurIPS 2021 workshop Causal Inference Challenges in Sequential Decision Making: Bridging Theory and Practice