中文

方差依赖的最优臂辨识

机器学习 2023-05-30 v3 机器学习

摘要

我们研究随机多臂老虎机博弈中辨识最优臂的问题。给定一组从 11nn 编号的 nn 个臂,每个臂 ii 关联一个支撑于 [0,1][0,1] 上的未知奖励分布,其均值为 θi\theta_i、方差为 σi2\sigma_i^2。假设 θ1>θ2θn\theta_1 > \theta_2 \geq \cdots \geq\theta_n。我们提出一种自适应算法,该算法探索各臂奖励的间隙与方差,并利用一种称为\textit{分组中位数消除}的新方法基于所收集的信息做出后续决策。所提算法保证以概率 (1δ)(1-\delta) 输出最优臂,且最多使用 O(i=1n(σi2Δi2+1Δi)(lnδ1+lnlnΔi1))O \left(\sum_{i = 1}^n \left(\frac{\sigma_i^2}{\Delta_i^2} + \frac{1}{\Delta_i}\right)(\ln \delta^{-1} + \ln \ln \Delta_i^{-1})\right) 个样本,其中 Δi\Delta_ii2i \geq 2)表示臂 ii 与最优臂之间的奖励间隙,我们定义 Δ1=Δ2\Delta_1 = \Delta_2。这在某些有利场景下相较与方差无关的算法取得了显著优势,并且是首个相比最优方法去除最优臂上额外 lnn\ln n 因子的结果。我们进一步证明,算法要实现相同目标,必要样本量为 Ω(i=1n(σi2Δi2+1Δi)lnδ1)\Omega \left( \sum_{i = 1}^n \left( \frac{\sigma_i^2}{\Delta_i^2} + \frac{1}{\Delta_i} \right) \ln \delta^{-1} \right),从而说明我们的算法在双对数项范围内是最优的。

关键词

引用

@article{arxiv.2106.10417,
  title  = {Variance-Dependent Best Arm Identification},
  author = {Pinyan Lu and Chao Tao and Xiaojin Zhang},
  journal= {arXiv preprint arXiv:2106.10417},
  year   = {2023}
}