中文

少切换线性_bandit:面向现实的因果效应优化

机器学习 2019-10-16 v2 机器学习

摘要

在许多现实场景中,过于频繁地变更策略是困难、不道德或昂贵的。毕竟,医生指南、税法和价目表只能偶尔重印。因此我们可能只希望在变更很可能有益时才更改策略。当策略是上下文变量上的阈值时,我们可以估计位于阈值处人群的处置效应。这允许一套增量式策略更新时间表,使我们在极少有害变更的同时优化策略。利用该思想及线性上下文 bandit 理论,我们提出一种保守的策略更新过程,仅在有理据时才更新确定性策略。我们将线性 bandit 理论扩展至这一少切换情形,证明此类过程与常见 LinUCB 算法享有相同(至多常数倍缩放)的 regret。然而该算法对其策略的变更远少,且其中有害变更更少。我们提供了仿真及对一个婴儿健康福祉因果推断数据集的分析,显示该算法以极少变更高效学得良好策略。我们的方法能高效求解需避免变更的问题,在医学、经济学等领域具潜在应用。

关键词

引用

@article{arxiv.1905.13121,
  title  = {Rarely-switching linear bandits: optimization of causal effects for the real world},
  author = {Benjamin Lansdell and Sofia Triantafillou and Konrad Kording},
  journal= {arXiv preprint arXiv:1905.13121},
  year   = {2019}
}

备注

17 pages, 9 figures