中文

阻塞式协同_bandit:带逐项预算约束的在线协同过滤

信息检索 2023-11-08 v1 机器学习 机器学习

摘要

我们考虑\emph{阻塞式}协同bandit问题,其中存在多个用户,每个用户关联一个多臂bandit问题。这些用户被分组为\emph{潜在}簇,使得同一簇内用户的均值奖励向量相同。我们的目标是设计算法,在所有用户随时间累积的奖励最大化的同时,满足\emph{约束}:每个用户的任一臂被拉动的次数不超过B\mathsf{B}次。该问题最初由\cite{Bresler:2014}提出,此后设计其遗憾最优算法一直是一个开放问题。本工作中,我们提出一种称为\texttt{B-LATTICE}(基于矩阵补全的阻塞式潜在bandit,Blocked Latent bAndiTs via maTrIx ComplEtion)的算法,该算法在用户间进行协作,同时满预算约束,以最大化其累积奖励。理论上,在潜在结构的某些合理假设下,对于M\mathsf{M}个用户、N\mathsf{N}个臂、每用户T\mathsf{T}轮以及C=O(1)\mathsf{C}=O(1)个潜在簇,\texttt{B-LATTICE}在预算约束B=Θ(logT)\mathsf{B}=\Theta(\log \mathsf{T})下实现了每用户O~(T(1+NM1)\widetilde{O}(\sqrt{\mathsf{T}(1 + \mathsf{N}\mathsf{M}^{-1})}的遗憾。这些是该问题的首批次线性遗憾界,并在B=T\mathsf{B}=\mathsf{T}时与极小极大遗憾界相匹配。实证上,我们证明即便在B=1\mathsf{B}=1时,我们的算法相较基线也具有更优性能。\texttt{B-LATTICE}分阶段运行,在每一阶段将用户聚类为组,并在组内跨用户协作以快速学习其奖励模型。

关键词

引用

@article{arxiv.2311.03376,
  title  = {Blocked Collaborative Bandits: Online Collaborative Filtering with Per-Item Budget Constraints},
  author = {Soumyabrata Pal and Arun Sai Suggala and Karthikeyan Shanmugam and Prateek Jain},
  journal= {arXiv preprint arXiv:2311.03376},
  year   = {2023}
}

备注

44 pages, To Appear in NeurIPS 2023