结合离线因果推断与在线_bandit学习的数据驱动决策
机器学习
2020-11-10 v2 机器学习
摘要
对于拥有大量日志数据的公司而言,一个基本问题是:如何将这些日志数据与 incoming 的流数据结合以做出良好决策?许多公司目前通过在线 A/B 测试做决策,但测试期间的错误决策会损害用户体验并造成不可逆的损害。一种典型的替代方案是离线因果推断,它仅分析日志数据来做决策。然而,这些决策不能适应新 incoming 的数据,因此一个错误决策会持续损害用户体验。为克服上述局限,我们提出一个框架以统一离线因果推断算法(例如加权、匹配)与在线学习算法(例如 UCB、LinUCB)。我们提出了新颖的算法,并通过“regret”的概念推导了决策精度的界。我们推导了基于森林的在线 bandit 算法的首个上 regret 界。在两个真实数据集上的实验表明,我们的算法优于仅使用日志数据或在线反馈的算法,或未能正确使用数据的算法。
引用
@article{arxiv.2001.05699,
title = {Combining Offline Causal Inference and Online Bandit Learning for Data Driven Decision},
author = {Li Ye and Yishi Lin and Hong Xie and John C. S. Lui},
journal= {arXiv preprint arXiv:2001.05699},
year = {2020}
}
备注
27 pages, 35 figures, 4 tables