中文

重访简单后悔:返回优质臂的快速率

机器学习 2023-02-03 v2

摘要

简单后悔是多臂老虎机纯探索中一种自然且无参数的性能准则,却不如错过最优臂或ϵ\epsilon-优质臂的概率常用,或许因其缺乏简便的刻画方式。本文中,我们在数据丰富(TnT\ge n)与数据匮乏(TnT \le n)两种情形下均对最小化简单后悔取得显著进展,其中nn为臂数,TT为样本数。其核心是我们对著名的Sequential Halving(SH)算法改进的实例依赖分析:对任意ϵ>0\epsilon>0的选择,我们界定了返回均值奖励距最优臂不在ϵ\epsilon内(即非ϵ\epsilon-优质)的臂的概率,尽管ϵ\epsilon并非SH的输入。我们的界不仅导出最优的最坏情形简单后悔界n/T\sqrt{n/T}(至多差对数因子),且基本匹配Katz-Samuels与Jamieson(2020)报道的返回ϵ\epsilon-优质臂的实例依赖下界。对更具挑战的数据匮乏情形,我们提出Bracketing SH(BSH),即使未对每个臂至少采样一次,也享有同样的改进。我们的实证研究表明BSH在真实任务上优于现有方法。

关键词

引用

@article{arxiv.2210.16913,
  title  = {Revisiting Simple Regret: Fast Rates for Returning a Good Arm},
  author = {Yao Zhao and Connor James Stephens and Csaba Szepesvári and Kwang-Sung Jun},
  journal= {arXiv preprint arXiv:2210.16913},
  year   = {2023}
}