中文

基于高斯过程且动作集时变的上下文组合_bandit 问题

机器学习 2025-09-26 v3 应用统计 机器学习

摘要

我们考虑一个具有组合动作集且基臂可用性随时间变化的上下文_bandit 问题。在每轮开始时,智能体观测可用基臂集合及其上下文,然后选择一个由可用基臂集合中可行子集构成的动作,以长期最大化其累积奖励。我们假设基臂的均值结果是从由上下文集合 X{\cal X} 索引的高斯过程(GP)中采样得到,且期望奖励在期望基臂结果中 Lipschitz 连续。针对该设定,我们提出一种称为基于核上置信界的最优组合学习与优化(O'CLOK-UCB)的算法,并证明它以高概率产生 O~(λ(K)KTγKT(tTXt))\tilde{O}(\sqrt{\lambda^*(K)KT\gamma_{KT}(\cup_{t\leq T}\mathcal{X}_t)} ) 的悔值,其中 γKT(tTXt)\gamma_{KT}(\cup_{t\leq T}\mathcal{X}_t) 是与前 TT 轮中出现的基臂上下文集合 Xt\mathcal{X}_t 相关的最大信息增益,KK 是所有轮次中任意可行动作的最大基数,λ(K)\lambda^*(K) 是截至时间 TT 所选动作的所有协方差矩阵的最大特征值,其为 KK 的函数。为大幅加速算法,我们还提出了一种使用稀疏 GP 的 O'CLOK-UCB 变体。最后,我们通过实验表明,两种算法均利用了基臂间结果相关性,并在实际设定中大幅优于先前最先进的基于 UCB 的算法。

关键词

引用

@article{arxiv.2110.02248,
  title  = {Contextual Combinatorial Bandits with Changing Action Sets via Gaussian Processes},
  author = {Andi Nika and Sepehr Elahi and Cem Tekin},
  journal= {arXiv preprint arXiv:2110.02248},
  year   = {2025}
}

备注

34 pages, 7 figures