中文

拟阵约束下的多臂赌博机纯探索

机器学习 2016-05-26 v3 数据结构与算法

摘要

我们研究随机多臂赌博机博弈中受拟阵约束的纯探索问题(最佳基)。在一个最佳基实例中,我们给定 nn 个具有未知奖励分布的随机臂,以及一个定义在臂上的拟阵 M\mathcal{M}。设臂的权重为其奖励分布的均值。我们的目标是使用尽可能少的样本,识别出 M\mathcal{M} 中总权重最大的一个基。该问题是近年来备受关注的最佳臂识别问题和前 kk 臂识别问题的显著推广。我们研究了最佳基问题的精确版本和PAC版本,并为这些版本提供了具有近乎最优样本复杂度的算法。我们的结果推广和/或改进了当组合约束为拟阵时,前 kk 臂识别问题和组合纯探索问题的若干先前结果。

关键词

引用

@article{arxiv.1605.07162,
  title  = {Pure Exploration of Multi-armed Bandit Under Matroid Constraints},
  author = {Lijie Chen and Anupam Gupta and Jian Li},
  journal= {arXiv preprint arXiv:1605.07162},
  year   = {2016}
}

备注

Accepted for presentation at Conference on Learning Theory (COLT) 2016