批量Bandit的推断
机器学习
2021-01-12 v3 机器学习
摘要
随着bandit算法在科学研究和工业应用中的使用日益增多,对基于由此产生的自适应收集数据的可靠推断方法的需求也相应增加。在本工作中,我们针对使用bandit算法分批收集的数据开发推断方法。我们首先证明,在独立采样数据上渐近正态的普通最小二乘估计量(OLS),在标准bandit算法收集的数据上(当不存在唯一最优臂时)并非渐近正态。这一渐近非正态性结果表明,假设OLS估计量近似正态的朴素做法可能导致第一类错误膨胀以及低于名义覆盖概率的置信区间。其次,我们引入批量OLS估计量(BOLS),并证明它(1)在来自多臂bandit和上下文bandit的数据上渐近正态,且(2)对基线奖励的非平稳性具有鲁棒性。
引用
@article{arxiv.2002.03217,
title = {Inference for Batched Bandits},
author = {Kelly W. Zhang and Lucas Janson and Susan A. Murphy},
journal= {arXiv preprint arXiv:2002.03217},
year = {2021}
}