中文

(Sticky) Track-and-Stop 的非渐近分析

机器学习 2026-02-19 v2

摘要

在纯探索问题中,统计学家按序收集信息,以回答关于某个随机且未知环境的问题。返回错误答案的概率不应超过最大风险参数 δ\delta,且优秀的算法应尽可能少地向环境进行查询。Track-and-Stop 算法是解决此类问题的先驱性方法。具体而言,众所周知,当从环境到其正确答案的映射为单值时(例如,具有唯一最优臂的最佳臂识别),该算法在 δ0\delta\to 0 时具有渐近最优的样本复杂度保证。Sticky Track-and-Stop 算法将这些结果扩展到了每个环境可能存在多个正确答案的设定(例如,ϵ\epsilon-最优臂识别)。尽管这两种方法在渐近机制下都是最优的,但它们的非渐近保证仍然未知。在这项工作中,我们填补了这一空白,并为这两种算法提供了非渐近保证。

关键词

引用

@article{arxiv.2505.22475,
  title  = {Non-Asymptotic Analysis of (Sticky) Track-and-Stop},
  author = {Riccardo Poiani and Martino Bernasconi and Andrea Celli},
  journal= {arXiv preprint arXiv:2505.22475},
  year   = {2026}
}