中文

基于情境 bandits 的校准化推荐

机器学习 2025-09-09 v1 信息检索 机器学习

摘要

Spotify 的首页呈现多种内容类型,包括音乐、播客和有声书。然而,历史数据严重偏向音乐,导致难以呈现均衡且个性化的内容组合。此外,用户对不同内容类型的偏好会因时间、星期或所使用的设备而异。我们提出一种校准方法,利用情境 bandits 动态学习每个用户基于其情境和偏好的最优内容类型分布。不同于依赖历史平均值的传统校准方法,我们的方法通过适应用户在不同情境下对不同内容类型兴趣的变化来提升参与度。离线和在线结果均表明,在提升 Spotify 首页的精确度和用户参与度方面均取得改进,尤其是针对如播客等欠代表型内容类型。

关键词

引用

@article{arxiv.2509.05460,
  title  = {Calibrated Recommendations with Contextual Bandits},
  author = {Diego Feijer and Himan Abdollahpouri and Sanket Gupta and Alexander Clare and Yuxiao Wen and Todd Wasson and Maria Dimakopoulou and Zahra Nazari and Kyle Kretschman and Mounia Lalmas},
  journal= {arXiv preprint arXiv:2509.05460},
  year   = {2025}
}

备注

Accepted at ACM RecSys '25, CONSEQUENCES workshop