中文

组合逻辑斯谛 Bandit

机器学习 2025-05-15 v3

摘要

我们引入了一个称为组合逻辑斯谛 bandit (CLogB) 的新框架,其中在每一轮中,选择一个基础臂子集(称为超臂),每个基础臂的结果是二元的,其期望遵循逻辑斯谛参数模型。反馈由一个通用的臂触发过程控制。我们的研究涵盖了具有满足两种平滑性条件的奖励函数的 CLogB,捕获了诸如在线内容交付、在线学习排序和动态信道分配等应用场景。我们首先提出了一种简单而高效的算法 CLogUCB,它利用了一个方差无关的探索奖励。在 1-范数触发概率调制 (TPM) 平滑性条件下,CLogUCB 实现了 O~(dκKT)\tilde{O}(d\sqrt{\kappa KT}) 的遗憾界,其中 O~\tilde{O} 忽略了对数因子,dd 是特征向量的维度,κ\kappa 表示逻辑斯谛模型的非线性程度,KK 是一个超臂可以触发的最大基础臂数量。这一结果比先前的工作改进了 O~(κ)\tilde{O}(\sqrt{\kappa}) 因子。然后,我们使用方差自适应版本 VA-CLogUCB 增强了 CLogUCB,在相同的 1-范数 TPM 条件下,该版本达到了 O~(dKT)\tilde{O}(d\sqrt{KT}) 的遗憾界,进一步改进了 O~(κ)\tilde{O}(\sqrt{\kappa}) 因子。在更强的触发概率和方差调制 (TPVM) 条件下,VA-CLogUCB 展现出更大的潜力,实现了领先的 O~(dT)\tilde{O}(d\sqrt{T}) 遗憾,从而消除了对动作大小 KK 的额外依赖。此外,当上下文特征映射是时不变时,我们通过消除非凸优化过程提高了 VA-CLogUCB 的计算效率,同时保持了紧凑的 O~(dT)\tilde{O}(d\sqrt{T}) 遗憾。最后,在合成和真实世界数据集上的实验表明,我们的算法相比基准算法具有优越的性能。

关键词

引用

@article{arxiv.2410.17075,
  title  = {Combinatorial Logistic Bandits},
  author = {Xutong Liu and Xiangxiang Dai and Xuchuang Wang and Mohammad Hajiesmaili and John C. S. Lui},
  journal= {arXiv preprint arXiv:2410.17075},
  year   = {2025}
}

备注

Accepted in ACM SIGMETRICS 2025