中文

用于个性化新闻推荐的两阶段神经上下文_bandit 方法

信息检索 2022-06-30 v1 机器学习

摘要

我们考虑个性化新闻推荐问题,其中每个用户以顺序方式消费新闻。现有的个性化新闻推荐方法侧重于利用用户兴趣,而忽略了推荐中的探索,这导致有偏的反馈循环并长期损害推荐质量。我们基于上下文_bandit 推荐策略构建方法,其天然地解决了利用与探索的权衡。主要挑战在于探索大规模物品空间的计算效率以及利用带有不确定性的深度表示。我们提出了一种两阶段层次化主题-新闻深度上下文_bandit 框架,以在存在众多新闻物品时高效学习用户偏好。我们对用户和新闻使用深度学习表示,并将神经上置信界(UCB)策略推广到广义加性 UCB 和双线性 UCB。在大规模新闻推荐数据集上的实证结果表明,我们所提出的策略高效且优于基线 bandit 策略。

关键词

引用

@article{arxiv.2206.14648,
  title  = {Two-Stage Neural Contextual Bandits for Personalised News Recommendation},
  author = {Mengyan Zhang and Thanh Nguyen-Tang and Fangzhao Wu and Zhenyu He and Xing Xie and Cheng Soon Ong},
  journal= {arXiv preprint arXiv:2206.14648},
  year   = {2022}
}