中文

改进具有概率触发臂的组合半强盗问题的遗憾界及其应用

机器学习 2021-06-09 v5 机器学习

摘要

我们研究具有概率触发臂的组合多臂强盗问题 (CMAB-T) 和半强盗反馈。我们解决了先前 CMAB-T 研究中的一个严重问题,即遗憾界包含一个可能呈指数级大的因子 1/p1/p^*,其中 pp^* 是任意动作触发某个臂的最小正概率。我们通过将触发概率调制 (TPM) 有界光滑性条件引入通用 CMAB-T 框架来解决此问题,并证明许多应用,如影响最大化强盗问题和组合级联强盗问题,都满足此 TPM 条件。结果,我们从遗憾界中完全移除了因子 1/p1/p^*,为影响最大化和级联强盗问题取得了显著优于以往的遗憾界。最后,我们提供的下界结果表明,对于一般的 CMAB-T 问题,因子 1/p1/p^* 是不可避免的,这提示 TPM 条件对于移除该因子至关重要。

关键词

引用

@article{arxiv.1703.01610,
  title  = {Improving Regret Bounds for Combinatorial Semi-Bandits with Probabilistically Triggered Arms and Its Applications},
  author = {Qinshi Wang and Wei Chen},
  journal= {arXiv preprint arXiv:1703.01610},
  year   = {2021}
}

备注

This is the full version of the paper accepted at NIPS'2017