多臂老虎机中的样本均值是正偏还是负偏?
统计理论
2019-10-29 v2 机器学习
统计理论
摘要
众所周知,在随机多臂老虎机(MAB)中,一个臂的样本均值通常并不是其真实均值的无偏估计量。在本文中,我们解耦了这种选择偏差的三个不同来源:对臂的自适应\emph{采样}、实验的自适应\emph{停止}、以及自适应\emph{选择}要研究的臂。通过一种称为“乐观性”的新概念,捕捉算法的某些自然单调行为,我们提供了关于乐观规则如何影响偏差符号的清晰且统一的分析。主要结论是:乐观采样引起负偏差,而乐观停止和乐观选择均引起正偏差。这些结果是在一个通用的随机 MAB 设定中推导的,该设定完全独立于实验的最终目的(遗憾最小化或最优臂识别或其他任何目的)。我们提供了每类乐观规则的例子,证明模拟证实了我们的理论预测,并提出了一些自然但困难的开放问题。
引用
@article{arxiv.1905.11397,
title = {Are sample means in multi-armed bandits positively or negatively biased?},
author = {Jaehyeok Shin and Aaditya Ramdas and Alessandro Rinaldo},
journal= {arXiv preprint arXiv:1905.11397},
year = {2019}
}
备注
21 pages. Advances in Neural Information Processing Systems 32 (NeurIPS 2019, Spotlight Presentation)