中文

具有概率触发臂的上下文组合_bandits

机器学习 2024-11-20 v3 人工智能 机器学习

摘要

我们研究具有概率触发臂的上下文组合_bandits(C2^2MAB-T),在多种平滑性条件下该问题涵盖广泛应用,例如上下文级联_bandits和上下文影响最大化_bandits。在触发概率调制(TPM)条件下,我们设计了C2^2-UCB-T算法并提出了一种新颖的分析,获得了O~(dKT)\tilde{O}(d\sqrt{KT})的悔界,去除了潜在指数级大的因子O(1/pmin)O(1/p_{\min}),其中dd为上下文维度,pminp_{\min}为任意臂可被触发的最小正概率,批大小KK为每轮可被触发的最大臂数。在方差调制(VM)或触发概率与方差调制(TPVM)条件下,我们提出一种新的方差自适应算法VAC2^2-UCB并推导出悔界O~(dT)\tilde{O}(d\sqrt{T}),该悔界与批大小KK无关。作为一个有价值的副产品,我们的分析技术和方差自适应算法可应用于CMAB-T和C2^2MAB设定,也改进了其中的现有结果。我们还包含了实验,在合成和真实世界数据集上展示了我们的算法相较基准算法的性能提升。

关键词

引用

@article{arxiv.2303.17110,
  title  = {Contextual Combinatorial Bandits with Probabilistically Triggered Arms},
  author = {Xutong Liu and Jinhang Zuo and Siwei Wang and John C. S. Lui and Mohammad Hajiesmaili and Adam Wierman and Wei Chen},
  journal= {arXiv preprint arXiv:2303.17110},
  year   = {2024}
}

备注

The 40th International Conference on Machine Learning (ICML), 2023