中文

相关多臂老虎机中的最优臂识别

机器学习 2021-09-13 v1 机器学习

摘要

在本文中,我们考虑固定置信度设置下多臂老虎机中的最优臂识别问题,其目标是在给定某个 δ>0\delta>0 的情况下,以 1δ1-\delta 的概率从臂集合 K\mathcal{K} 中以最少可能样本识别出具有最高平均奖励的臂。现有的大多数最优臂识别算法和分析都在假设不同臂对应的奖励相互独立的情况下运行。我们提出了一种新的相关老虎机框架,该框架以给定来自另一个臂的奖励实现时某臂期望条件奖励的上界形式,捕获关于臂之间相关性的领域知识。我们提出的算法 C-LUCB 推广了 LUCB 算法,利用这种部分相关性知识大幅降低了最优臂识别的样本复杂度。更有趣的是,我们表明 C-LUCB 获得的总样本形式为 O(kClog(1δ))\mathcal{O}\left(\sum_{k \in \mathcal{C}} \log\left(\frac{1}{\delta}\right)\right),而独立奖励设置下通常需要 O(kKlog(1δ))\mathcal{O}\left(\sum_{k \in \mathcal{K}} \log\left(\frac{1}{\delta}\right)\right) 个样本。这种改进来自于 O(log(1/δ))\mathcal{O}(\log(1/\delta)) 项仅对竞争臂集合 C\mathcal{C} 求和,而 C\mathcal{C} 是原始臂集合 K\mathcal{K} 的子集。集合 C\mathcal{C} 的大小取决于问题设置,可以小至 22,因此在相关老虎机设置中使用 C-LUCB 可以带来显著的性能提升。我们的理论发现得到了在 Movielens 和 Goodreads 推荐数据集上的实验支持。

关键词

引用

@article{arxiv.2109.04941,
  title  = {Best-Arm Identification in Correlated Multi-Armed Bandits},
  author = {Samarth Gupta and Gauri Joshi and Osman Yağan},
  journal= {arXiv preprint arXiv:2109.04941},
  year   = {2021}
}