中文

面向大规模推荐系统的贝叶斯非平稳线性_bandits

机器学习 2023-07-26 v2 机器学习

摘要

利用上下文信息有可能提升推荐系统的性能。在大数据时代,此类侧信息往往具有多个维度。因此,开发能够实时应对如此高维上下文的决策算法至关重要。当决策者可推荐的物品种类多样时,这一问题尤为具有挑战性。此外,物品热度或用户偏好的变化会因缺乏对环境分布偏移的鲁棒性而阻碍已部署推荐系统的性能。本文中,我们基于线性上下文多臂_bandit框架来解决该问题。我们针对具有高维特征向量、大量臂以及非平稳奖励生成过程的线性_bandit问题开发了决策策略。我们基于 Thompson 采样的策略利用随机投影降低特征向量维度,并使用指数递增权重随时间减小过去观测的影响。我们提出的推荐系统采用该策略在线学习用户的物品偏好,同时最小化运行时间。我们证明了 regret 界随降维后的维度而非原始维度成比例。为在数值上评估所提推荐系统,我们将其应用于三个真实世界数据集。理论与数值结果表明,与最先进水平相比,我们所提算法在计算复杂度和 regret 性能之间取得了有效权衡。

关键词

引用

@article{arxiv.2202.03167,
  title  = {Bayesian Non-stationary Linear Bandits for Large-Scale Recommender Systems},
  author = {Saeed Ghoorchian and Evgenii Kortukov and Setareh Maghsudi},
  journal= {arXiv preprint arXiv:2202.03167},
  year   = {2023}
}

备注

30 pages, 12 figures