中文

带线性约束的赌博机中的纯探索问题

机器学习 2024-01-26 v4

摘要

我们研究了在多臂赌博机设定下以固定置信水平识别最优策略的问题,其中臂受到线性约束。与已被充分研究的标准最佳臂识别问题不同,这种情况下的最优策略可能不是确定性的,而可能在多个臂之间进行混合。这改变了问题的几何结构,我们通过信息论下界对其进行了刻画。我们针对该设定引入了两种渐近最优算法,一种基于 Track-and-Stop 方法,另一种基于博弈论方法。这两种算法都试图根据下界追踪一种最优分配,该分配通过计算到法锥边界上的加权投影得到。最后,我们提供了经验结果来验证我们的界,并可视化约束如何改变问题的难度。

关键词

引用

@article{arxiv.2306.12774,
  title  = {Pure Exploration in Bandits with Linear Constraints},
  author = {Emil Carlsson and Debabrota Basu and Fredrik D. Johansson and Devdatt Dubhashi},
  journal= {arXiv preprint arXiv:2306.12774},
  year   = {2024}
}

备注

Accepted to AISTATS 2024