中文

理解图反馈下的Bandit问题

机器学习 2021-11-02 v2 数据结构与算法 机器学习

摘要

[Mannor and Shamir, NeurIPS 2011] 提出的图反馈 bandit 问题由一个有向图 G=(V,E)G=(V,E) 建模,其中 VV 是 bandit 臂的集合,一旦某个臂被触发,其所有关联臂均被观测。一个基本问题是如何图的结构影响极小极大后悔(min-max regret)。我们提出分数弱支配数 δ\delta^*kk- packing 独立数的概念,分别给出后悔的上界和下界。我们表明这两个概念通过将它们分别与弱支配集的线性规划及其对偶——分数顶点 packing 集对齐而内在相连。基于该联系,我们利用强对偶定理证明一般后悔上界 O((δlogV)13T23)O\left(\left( \delta^*\log |V|\right)^{\frac{1}{3}}T^{\frac{2}{3}}\right) 和下界 Ω((δ/α)13T23)\Omega\left(\left(\delta^*/\alpha\right)^{\frac{1}{3}}T^{\frac{2}{3}}\right),其中 α\alpha 是对偶线性规划的整数间隙(integrality gap)。因此,对于顶点 packing 问题整数间隙有界的图(包括树和度数有界图),我们的界在 (logV)13\left(\log |V|\right)^{\frac{1}{3}} 因子内是紧的。此外,我们展示对于几类特殊图族,可去除 (logV)13\left(\log |V|\right)^{\frac{1}{3}} 因子并建立最优后悔。

关键词

引用

@article{arxiv.2105.14260,
  title  = {Understanding Bandits with Graph Feedback},
  author = {Houshuang Chen and Zengfeng Huang and Shuai Li and Chihao Zhang},
  journal= {arXiv preprint arXiv:2105.14260},
  year   = {2021}
}

备注

To be published in NeurIPS'21