中文

截止期限下的 PAC 最优臂辨识

机器学习 2021-06-09 v2 人工智能 机器学习

摘要

我们研究 (ϵ,δ)(\epsilon, \delta)-PAC 最优臂辨识问题,其中决策者必须以至少 1δ1 - \delta 的概率辨识出一个 ϵ\epsilon-最优臂,同时最小化拉臂次数(样本数)。该主题的大部分工作处于序贯设定中,即对辨识此类臂所需时间无约束;这使得决策者可以一次拉一个臂。在本文工作中,决策者被给定 TT 轮的截止期限,在每一轮中,它可以自适应地选择拉哪些臂以及拉多少次;这将所作决策的数量(即时间或轮数)与所获取样本的数量(代价)区分开来。此类情形出现在临床试验中,其中可能需要在截止期限下辨识出有前景的疗法,同时最小化受试对象数量;或出现在云端基于仿真的研究中,其中我们可以弹性地扩缩虚拟机数量以开展任意多实验,但需为所使用的资源时间付费。由于决策者只能作出 TT 次决策,为了在所有可能问题上表现良好,它相对于序贯算法可能需过度拉取某些臂。我们用两条困难性结果形式化了这一额外困难,表明与序贯设定不同,适应问题难度的能力受限于有限截止期限。我们提出弹性批量竞赛(Elastic Batch Racing, EBR),一种用于该设定的新算法,并界定其样本复杂度,表明 EBR 相对于两条困难性结果均为最优。我们给出了在该设定下评估 EBR 的仿真,其性能优于基线数个数量级。

关键词

引用

@article{arxiv.2106.03221,
  title  = {PAC Best Arm Identification Under a Deadline},
  author = {Brijen Thananjeyan and Kirthevasan Kandasamy and Ion Stoica and Michael I. Jordan and Ken Goldberg and Joseph E. Gonzalez},
  journal= {arXiv preprint arXiv:2106.03221},
  year   = {2021}
}

备注

In submission