中文

带背包的聚类线性上下文_bandits

机器学习 2023-08-22 v1 机器学习

摘要

在这项工作中,我们研究聚类上下文_bandits,其中奖励和资源消耗是聚类特定线性模型的结果。臂被划分为若干聚类,且聚类归属对算法未知。在一个时间段内拉动一个臂会产生奖励,并对多种资源中的每一种产生消耗,且任一资源的总消耗超过约束即意味着算法终止。因此,最大化总奖励不仅需要学习关于奖励和资源消耗的模型,还需要学习聚类归属。我们提供一种算法,其在时间周期数上实现次线性后悔,且不需要访问所有臂。特别地,我们表明仅需对随机选取的臂子集进行一次聚类即可。为达成该结果,我们提供了来自计量经济学文献与带约束_bandits文献技术的精细组合。

关键词

引用

@article{arxiv.2308.10722,
  title  = {Clustered Linear Contextual Bandits with Knapsacks},
  author = {Yichuan Deng and Michalis Mamakos and Zhao Song},
  journal= {arXiv preprint arXiv:2308.10722},
  year   = {2023}
}