中文

大规模推荐系统中的缓存感知强化学习

机器学习 2025-04-09 v1 信息检索

摘要

现代大规模推荐系统建立在计算密集型基础设施之上,通常面临峰值和非峰值时段流量巨大差异的问题。在峰值时段,由于计算资源预算有限,对每个请求进行实时计算具有挑战性。带缓存的推荐是解决此问题的一种方案,其中使用用户级结果缓存在推荐系统无法承担实时计算时提供推荐。然而,与实时计算相比,缓存推荐通常次优,并且确定每个用户的缓存项具有挑战性。在本文中,我们提出了一种缓存感知强化学习(CARL)方法,以联合优化实时计算和缓存的推荐。我们将问题建模为具有用户状态和缓存状态的马尔可夫决策过程,其中缓存状态表示推荐系统是通过实时计算还是通过缓存进行推荐。推荐系统的计算负载决定缓存状态。我们基于该模型进行强化学习,以提高多个请求的用户参与度。此外,我们表明缓存会引入一个称为批评者依赖性的挑战,这会降低强化学习的性能。为了应对这一挑战,我们提出了一种特征函数学习(EL)方法来学习CARL的独立批评者。实验表明,在考虑结果缓存时,CARL可以显著提高用户参与度。CARL已在快手应用中全面上线,服务超过1亿用户。

关键词

引用

@article{arxiv.2404.14961,
  title  = {Cache-Aware Reinforcement Learning in Large-Scale Recommender Systems},
  author = {Xiaoshuang Chen and Gengrui Zhang and Yao Wang and Yulin Wu and Shuo Su and Kaiqiao Zhan and Ben Wang},
  journal= {arXiv preprint arXiv:2404.14961},
  year   = {2025}
}

备注

8 pages, 8 figures