阻塞式协同_bandit:带逐项预算约束的在线协同过滤
信息检索
2023-11-08 v1 机器学习
机器学习
摘要
我们考虑\emph{阻塞式}协同bandit问题,其中存在多个用户,每个用户关联一个多臂bandit问题。这些用户被分组为\emph{潜在}簇,使得同一簇内用户的均值奖励向量相同。我们的目标是设计算法,在所有用户随时间累积的奖励最大化的同时,满足\emph{约束}:每个用户的任一臂被拉动的次数不超过次。该问题最初由\cite{Bresler:2014}提出,此后设计其遗憾最优算法一直是一个开放问题。本工作中,我们提出一种称为\texttt{B-LATTICE}(基于矩阵补全的阻塞式潜在bandit,Blocked Latent bAndiTs via maTrIx ComplEtion)的算法,该算法在用户间进行协作,同时满预算约束,以最大化其累积奖励。理论上,在潜在结构的某些合理假设下,对于个用户、个臂、每用户轮以及个潜在簇,\texttt{B-LATTICE}在预算约束下实现了每用户的遗憾。这些是该问题的首批次线性遗憾界,并在时与极小极大遗憾界相匹配。实证上,我们证明即便在时,我们的算法相较基线也具有更优性能。\texttt{B-LATTICE}分阶段运行,在每一阶段将用户聚类为组,并在组内跨用户协作以快速学习其奖励模型。
引用
@article{arxiv.2311.03376,
title = {Blocked Collaborative Bandits: Online Collaborative Filtering with Per-Item Budget Constraints},
author = {Soumyabrata Pal and Arun Sai Suggala and Karthikeyan Shanmugam and Prateek Jain},
journal= {arXiv preprint arXiv:2311.03376},
year = {2023}
}
备注
44 pages, To Appear in NeurIPS 2023