中文

结构化阈值赌博机问题的依赖问题视角

机器学习 2021-06-21 v1 机器学习

摘要

我们在若干形状约束下研究随机阈值赌博机问题(TBP)中的依赖问题机制。在 TBP 中,学习者的目标是在序贯博弈结束时输出均值高于给定阈值的臂集合。无结构的基本情形已在文献中被充分研究。取 KK 为臂的数量,我们考虑(i)臂均值序列 (μk)k=1K(\mu_k)_{k=1}^K 单调递增(MTBP)以及(ii)(μk)k=1K(\mu_k)_{k=1}^K 为凹(CTBP)的情形。我们在依赖问题机制下考虑这两种情形,并研究错误概率——即至少误分类一个臂的概率。在固定预算设定下,我们给出了凹和单调设定中错误概率的上界和下界,以及相应的算法。在两种设定中,依赖问题机制下的界在指数项上相差不超过普适常数。

关键词

引用

@article{arxiv.2106.10166,
  title  = {Problem Dependent View on Structured Thresholding Bandit Problems},
  author = {James Cheshire and Pierre Ménard and Alexandra Carpentier},
  journal= {arXiv preprint arXiv:2106.10166},
  year   = {2021}
}

备注

25 pages. arXiv admin note: text overlap with arXiv:2006.10006