中文

面向推荐系统的神经组合聚类赌博机

机器学习 2025-04-22 v1 人工智能

摘要

我们考虑上下文组合赌博机设置,其中在每个回合中,学习代理(例如推荐系统)选择一个“臂”子集(例如产品),并观察单个基础臂(其是已知特征(称为“上下文”)的函数)和超级臂(臂的子集,其是基础臂奖励的函数)的奖励。代理的目标是同时学习未知的奖励函数并选择最高奖励的臂。例如,“奖励”可能代表用户点击推荐产品之一的概率。然而,传统的赌博机模型为了获得性能保证而采用限制性的奖励函数模型。我们利用深度神经网络来估计和学习未知的奖励函数,并提出了神经UCB聚类(NeUClust),它采用聚类方法通过利用上下文空间中的潜在结构在每个回合中选择超级臂。与先前的神经赌博机工作不同,NeUClust使用神经网络来估计超级臂奖励并选择超级臂,从而消除了对已知优化预言机的需求。我们非平凡地扩展了先前的神经组合赌博机工作,证明了NeUClust实现了O~(d~T)\widetilde{O}\left(\widetilde{d}\sqrt{T}\right)的遗憾,其中d~\widetilde{d}是神经正切核矩阵的有效维度,TT是回合数。在真实世界推荐数据集上的实验表明,NeUClust比其他上下文组合和神经赌博机算法实现了更好的遗憾和奖励。

关键词

引用

@article{arxiv.2410.14586,
  title  = {Neural Combinatorial Clustered Bandits for Recommendation Systems},
  author = {Baran Atalar and Carlee Joe-Wong},
  journal= {arXiv preprint arXiv:2410.14586},
  year   = {2025}
}