结构化阈值赌博机问题的依赖问题视角
机器学习
2021-06-21 v1 机器学习
摘要
我们在若干形状约束下研究随机阈值赌博机问题(TBP)中的依赖问题机制。在 TBP 中,学习者的目标是在序贯博弈结束时输出均值高于给定阈值的臂集合。无结构的基本情形已在文献中被充分研究。取 为臂的数量,我们考虑(i)臂均值序列 单调递增(MTBP)以及(ii) 为凹(CTBP)的情形。我们在依赖问题机制下考虑这两种情形,并研究错误概率——即至少误分类一个臂的概率。在固定预算设定下,我们给出了凹和单调设定中错误概率的上界和下界,以及相应的算法。在两种设定中,依赖问题机制下的界在指数项上相差不超过普适常数。
引用
@article{arxiv.2106.10166,
title = {Problem Dependent View on Structured Thresholding Bandit Problems},
author = {James Cheshire and Pierre Ménard and Alexandra Carpentier},
journal= {arXiv preprint arXiv:2106.10166},
year = {2021}
}
备注
25 pages. arXiv admin note: text overlap with arXiv:2006.10006