重访简单后悔:返回优质臂的快速率
机器学习
2023-02-03 v2
摘要
简单后悔是多臂老虎机纯探索中一种自然且无参数的性能准则,却不如错过最优臂或-优质臂的概率常用,或许因其缺乏简便的刻画方式。本文中,我们在数据丰富()与数据匮乏()两种情形下均对最小化简单后悔取得显著进展,其中为臂数,为样本数。其核心是我们对著名的Sequential Halving(SH)算法改进的实例依赖分析:对任意的选择,我们界定了返回均值奖励距最优臂不在内(即非-优质)的臂的概率,尽管并非SH的输入。我们的界不仅导出最优的最坏情形简单后悔界(至多差对数因子),且基本匹配Katz-Samuels与Jamieson(2020)报道的返回-优质臂的实例依赖下界。对更具挑战的数据匮乏情形,我们提出Bracketing SH(BSH),即使未对每个臂至少采样一次,也享有同样的改进。我们的实证研究表明BSH在真实任务上优于现有方法。
引用
@article{arxiv.2210.16913,
title = {Revisiting Simple Regret: Fast Rates for Returning a Good Arm},
author = {Yao Zhao and Connor James Stephens and Csaba Szepesvári and Kwang-Sung Jun},
journal= {arXiv preprint arXiv:2210.16913},
year = {2023}
}