中文

在线匹配:面向大规模推荐的实时 Bandit 系统

机器学习 2023-08-01 v1

摘要

过去十年见证了基于深度学习的模型在工业级推荐系统中的诸多成功。这些模型通常以批处理方式离线训练。尽管能有效捕捉用户与推荐平台的历史交互,批学习存在模型更新延迟长、易受系统偏差影响的缺陷,难以适应分布偏移并探索新物品或用户兴趣。尽管基于在线学习的方法(如多臂 Bandit)在应对这些挑战上展现出有前景的理论结果,其在大规模推荐系统中的实际实时部署仍有限。首先,在线方法在服务于海量在线流量的同时保证 Bandit 参数的及时更新,可扩展性是一大挑战。此外,在推荐系统中探索不确定性易致不良用户体验,亟需设计精细策略以有效平衡利用与探索的权衡。本文引入 Online Matching:一个可扩展的闭环 Bandit 系统,实时从用户对物品的直接反馈中学习。我们提出一种构建该系统的“离线+在线”混合方法,并完整阐述端到端系统架构。我们提出 Diag-LinUCB——LinUCB 算法的新颖扩展——以可扩展且及时的方式实现 Bandit 参数的分布式更新。我们在 YouTube 上进行线上实验,表明 Online Matching 能够增强当前平台中新鲜内容发现与物品探索的能力。

关键词

引用

@article{arxiv.2307.15893,
  title  = {Online Matching: A Real-time Bandit System for Large-scale Recommendations},
  author = {Xinyang Yi and Shao-Chuan Wang and Ruining He and Hariharan Chandrasekaran and Charles Wu and Lukasz Heldt and Lichan Hong and Minmin Chen and Ed H. Chi},
  journal= {arXiv preprint arXiv:2307.15893},
  year   = {2023}
}

备注

RecSys 2023