改进具有概率触发臂的组合半强盗问题的遗憾界及其应用
机器学习
2021-06-09 v5 机器学习
摘要
我们研究具有概率触发臂的组合多臂强盗问题 (CMAB-T) 和半强盗反馈。我们解决了先前 CMAB-T 研究中的一个严重问题,即遗憾界包含一个可能呈指数级大的因子 ,其中 是任意动作触发某个臂的最小正概率。我们通过将触发概率调制 (TPM) 有界光滑性条件引入通用 CMAB-T 框架来解决此问题,并证明许多应用,如影响最大化强盗问题和组合级联强盗问题,都满足此 TPM 条件。结果,我们从遗憾界中完全移除了因子 ,为影响最大化和级联强盗问题取得了显著优于以往的遗憾界。最后,我们提供的下界结果表明,对于一般的 CMAB-T 问题,因子 是不可避免的,这提示 TPM 条件对于移除该因子至关重要。
引用
@article{arxiv.1703.01610,
title = {Improving Regret Bounds for Combinatorial Semi-Bandits with Probabilistically Triggered Arms and Its Applications},
author = {Qinshi Wang and Wei Chen},
journal= {arXiv preprint arXiv:1703.01610},
year = {2021}
}
备注
This is the full version of the paper accepted at NIPS'2017