基于高斯过程且动作集时变的上下文组合_bandit 问题
机器学习
2025-09-26 v3 应用统计
机器学习
摘要
我们考虑一个具有组合动作集且基臂可用性随时间变化的上下文_bandit 问题。在每轮开始时,智能体观测可用基臂集合及其上下文,然后选择一个由可用基臂集合中可行子集构成的动作,以长期最大化其累积奖励。我们假设基臂的均值结果是从由上下文集合 索引的高斯过程(GP)中采样得到,且期望奖励在期望基臂结果中 Lipschitz 连续。针对该设定,我们提出一种称为基于核上置信界的最优组合学习与优化(O'CLOK-UCB)的算法,并证明它以高概率产生 的悔值,其中 是与前 轮中出现的基臂上下文集合 相关的最大信息增益, 是所有轮次中任意可行动作的最大基数, 是截至时间 所选动作的所有协方差矩阵的最大特征值,其为 的函数。为大幅加速算法,我们还提出了一种使用稀疏 GP 的 O'CLOK-UCB 变体。最后,我们通过实验表明,两种算法均利用了基臂间结果相关性,并在实际设定中大幅优于先前最先进的基于 UCB 的算法。
引用
@article{arxiv.2110.02248,
title = {Contextual Combinatorial Bandits with Changing Action Sets via Gaussian Processes},
author = {Andi Nika and Sepehr Elahi and Cem Tekin},
journal= {arXiv preprint arXiv:2110.02248},
year = {2025}
}
备注
34 pages, 7 figures