中文

概率排序与奖励:一种可扩展的 slate 推荐模型

信息检索 2024-07-08 v3 机器学习 机器学习

摘要

我们提出概率排序与奖励(PRR),一种用于个性化 slate 推荐的可扩展概率模型。我们的方法允许在用户与包含 K 个物品的 slate 中至多一个物品交互的场景下进行离屏奖励估计。我们表明,slate 成功的概率可以通过结合奖励(用户是否成功与 slate 交互)和排序(slate 中被选中的物品)来高效学习。PRR 优于现有的离屏奖励优化方法,并且对大型动作空间具有远更好的可扩展性。此外,PRR 允许通过最大内积搜索(MIPS)快速提供推荐,使其适用于计算广告等低延迟领域。

关键词

引用

@article{arxiv.2208.06263,
  title  = {Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation},
  author = {Imad Aouali and Achraf Ait Sidi Hammou and Otmane Sakhi and David Rohde and Flavian Vasile},
  journal= {arXiv preprint arXiv:2208.06263},
  year   = {2024}
}