中文

随机多臂老虎机中寻找所有 ε-优臂

机器学习 2020-09-14 v2 机器学习

摘要

随机多臂老虎机中的纯探索问题旨在找到一个或多个均值最大(或接近最大)的臂。例子包括寻找 ε-优臂、最优臂辨识、top-k 臂辨识,以及寻找所有均值高于指定阈值的臂。然而,尽管该目标在许多应用中或许是最自然的目标,寻找所有 ε-优臂的问题在过去工作中被忽视了。例如,病毒学家可能对大量候选疗法进行初步实验室实验,并将所有 ε-优疗法推进至更昂贵的临床试验。由于最终的临床疗效不确定,识别所有 ε-优候选者十分重要。从数学上看,所有 ε-优臂辨识问题带来了过去纯探索目标中未出现的显著新挑战与意外情况。我们引入了两种算法来克服这些困难,并在纽约客漫画配文大赛收集的 220 万条评分的大规模众包数据集以及测试数百种可能抗癌药物的数据集上展示了其优异的经验性能。

关键词

引用

@article{arxiv.2006.08850,
  title  = {Finding All {\epsilon}-Good Arms in Stochastic Bandits},
  author = {Blake Mason and Lalit Jain and Ardhendu Tripathy and Robert Nowak},
  journal= {arXiv preprint arXiv:2006.08850},
  year   = {2020}
}

备注

93 total pages (8 main pages + appendices), 12 figures, submitted to NeurIPS 2020