中文

细看具有图反馈的赌博机的小损失界

机器学习 2020-06-24 v2 机器学习

摘要

我们研究具有图反馈的对抗式多臂赌博机(multi-armed bandits)的小损失界,即依赖于最优臂损失或相关量的自适应后悔界,而非总轮数。我们推导了一般强可观测图的首个小损失界,解决了 Lykouris 等人(2018)的一个开放问题。具体而言,我们开发了一种算法,其后悔为 \mathcal{\tilde{O}}(\sqrt{\kappa L_*),其中 κ\kappa 为团划分数,LL_* 为最优臂损失;对于每臂均有自环的特殊自感知图,我们将后悔改进为 O~(min{αT,κL})\mathcal{\tilde{O}}(\min\{\sqrt{\alpha T}, \sqrt{\kappa L_*}\}),其中 ακ\alpha \leq \kappa 为独立数。我们的结果显著改进并扩展了 Lykouris 等人(2018)仅考虑自感知无向图的工作。此外,我们还首次尝试推导弱可观测图的小损失界。我们首先证明在此情形下无法达到典型的小损失界,然后提出了具有基于特定臂子集损失的替代小损失界的算法。一个令人惊讶的侧面结果是,只要最优臂具有自环,即使对于弱可观测图也能达到 O~(T)\mathcal{\tilde{O}}(\sqrt{T}) 后悔。我们的算法基于在线镜像下降(Online Mirror Descent)框架,但需要一系列可能具有独立意义的新技术。而且,我们所有算法均可在不知晓环境的情况下实现无参数化。

关键词

引用

@article{arxiv.2002.00315,
  title  = {A Closer Look at Small-loss Bounds for Bandits with Graph Feedback},
  author = {Chung-Wei Lee and Haipeng Luo and Mengxiao Zhang},
  journal= {arXiv preprint arXiv:2002.00315},
  year   = {2020}
}