中文

面向 REINFORCE 推荐系统的 Top-K 离屏修正

机器学习 2021-12-16 v3 信息检索 机器学习

摘要

工业推荐系统面临极大的动作空间——数以百万计的推荐条目。此外,它们需要服务数十亿用户,这些用户在任意时刻都是独特的,从而构成了复杂的用户状态空间。幸运的是,海量的日志隐式反馈(例如用户点击、停留时长)可用于学习。然而,从日志反馈中学习会受到偏置的影响,这些偏置源于仅观察到由先前版本推荐系统所选推荐的反馈。本工作中,我们提出一套通用方案,在 Youtube 上基于策略梯度算法(即 REINFORCE)构建的生产级 top-K 推荐系统中处理此类偏置。本文的贡献为:(1) 将 REINFORCE 扩展到动作空间达数百万量级的生产推荐系统;(2) 应用离屏修正以解决从多行为策略收集的日志反馈中的数据偏置;(3) 提出一种新颖的 top-K 离屏修正,以考虑我们的策略同时推荐多个条目;(4) 展示探索的价值。我们通过一系列仿真与 Youtube 上的多次线上实验证明了方法的有效性。

关键词

引用

@article{arxiv.1812.02353,
  title  = {Top-K Off-Policy Correction for a REINFORCE Recommender System},
  author = {Minmin Chen and Alex Beutel and Paul Covington and Sagar Jain and Francois Belletti and Ed Chi},
  journal= {arXiv preprint arXiv:1812.02353},
  year   = {2021}
}