中文

在最大化上下文赌博机奖励中利用异质溢出效应

机器学习 2025-12-10 v2 社会与信息网络

摘要

依赖上下文多臂赌博机的推荐系统通过考虑上下文信息持续改进相关物品的推荐。赌博机算法的目标是为每个用户学习最佳臂(例如最佳推荐物品),从而最大化用户与推荐互动所产生的累积奖励。这些算法通常考虑的上下文是用户与物品属性。然而,在社交网络背景下,由于一个用户的行为会影响其他用户的行为与奖励,邻居的行为也是非常重要的上下文,因为它们不仅具有预测能力,还能通过溢出效应影响未来奖励。此外,基于个人偏好及与他人关系的亲疏,影响易感性因人而异,这导致溢出效应存在异质性。在此,我们提出一个框架,使上下文多臂赌博机在为每个用户选择最佳臂时能够考虑此类异质溢出效应。我们在多个半合成与真实世界数据集上的实验表明,与忽略网络信息及潜在溢出效应的现有 SOTA 方案相比,我们的框架带来了显著更高的奖励。

关键词

引用

@article{arxiv.2310.10259,
  title  = {Leveraging heterogeneous spillover in maximizing contextual bandit rewards},
  author = {Ahmed Sayeed Faruk and Elena Zheleva},
  journal= {arXiv preprint arXiv:2310.10259},
  year   = {2025}
}