组合逻辑斯谛 Bandit
机器学习
2025-05-15 v3
摘要
我们引入了一个称为组合逻辑斯谛 bandit (CLogB) 的新框架,其中在每一轮中,选择一个基础臂子集(称为超臂),每个基础臂的结果是二元的,其期望遵循逻辑斯谛参数模型。反馈由一个通用的臂触发过程控制。我们的研究涵盖了具有满足两种平滑性条件的奖励函数的 CLogB,捕获了诸如在线内容交付、在线学习排序和动态信道分配等应用场景。我们首先提出了一种简单而高效的算法 CLogUCB,它利用了一个方差无关的探索奖励。在 1-范数触发概率调制 (TPM) 平滑性条件下,CLogUCB 实现了 的遗憾界,其中 忽略了对数因子, 是特征向量的维度, 表示逻辑斯谛模型的非线性程度, 是一个超臂可以触发的最大基础臂数量。这一结果比先前的工作改进了 因子。然后,我们使用方差自适应版本 VA-CLogUCB 增强了 CLogUCB,在相同的 1-范数 TPM 条件下,该版本达到了 的遗憾界,进一步改进了 因子。在更强的触发概率和方差调制 (TPVM) 条件下,VA-CLogUCB 展现出更大的潜力,实现了领先的 遗憾,从而消除了对动作大小 的额外依赖。此外,当上下文特征映射是时不变时,我们通过消除非凸优化过程提高了 VA-CLogUCB 的计算效率,同时保持了紧凑的 遗憾。最后,在合成和真实世界数据集上的实验表明,我们的算法相比基准算法具有优越的性能。
引用
@article{arxiv.2410.17075,
title = {Combinatorial Logistic Bandits},
author = {Xutong Liu and Xiangxiang Dai and Xuchuang Wang and Mohammad Hajiesmaili and John C. S. Lui},
journal= {arXiv preprint arXiv:2410.17075},
year = {2025}
}
备注
Accepted in ACM SIGMETRICS 2025