中文

无限臂老虎机的渐近最优纯探索

机器学习 2023-06-06 v1 机器学习

摘要

我们研究由未知分布独立同分布生成的无限多个老虎机臂的纯探索问题。我们的目标是高效选择一个高质量臂,其平均奖励以概率 1δ1-\delta 处于前 η\eta 比例臂的 ε\varepsilon 范围内;这是经典 PAC 保证对无限动作集的自然推广。我们考虑固定置信度和固定预算两种设定,分别旨在最小化期望样本复杂度和固定样本复杂度。对于固定置信度,我们给出一种期望样本复杂度为 O(log(1/η)log(1/δ)ηε2)O\left(\frac{\log (1/\eta)\log (1/\delta)}{\eta\varepsilon^2}\right) 的算法。该结果除 log(1/η)\log (1/\eta) 因子外是最优的,且其 δ\delta 依赖关系填补了文献中的二次差距。对于固定预算,我们证明当 δ0\delta\to 0 时渐近最优样本复杂度的首项为 c1log(1/δ)(loglog(1/δ))2c^{-1}\log(1/\delta)\big(\log\log(1/\delta)\big)^2。等价地,给定恰好 NN 个样本时的最优失败概率按 exp(cN/log2N)\exp\big(-cN/\log^2 N\big) 衰减,指数内至多一个因子 1±oN(1)1\pm o_N(1)。常数 cc 通过某种 Fisher 信息距离显式依赖于问题参数(包括未知臂分布)。甚至这种对 log(1/δ)\log(1/\delta) 的严格超线性依赖此前也未知,并解决了 Grossman 和 Moshkovitz(FOCS 2016,SIAM Journal on Computing 2020)的一个问题。

关键词

引用

@article{arxiv.2306.01995,
  title  = {Asymptotically Optimal Pure Exploration for Infinite-Armed Bandits},
  author = {Xiao-Yue Gong and Mark Sellke},
  journal= {arXiv preprint arXiv:2306.01995},
  year   = {2023}
}