中文

RL-MPCA:一种基于强化学习的推荐系统多阶段计算分配方法

信息检索 2024-01-04 v1 人工智能 机器学习

摘要

推荐系统旨在从大量候选中向用户推荐最合适的物品。其计算成本随着用户请求数量和服务(或模型)复杂度的增加而增长。在计算资源(CR)限制下,如何在计算成本和业务收益之间取得平衡成为一个关键问题。现有研究主要关注队列截断场景(即分配候选集大小)中的动态CR分配,并将CR分配问题建模为带约束的优化问题。其中一些研究关注单阶段CR分配,另一些关注多阶段CR分配,但引入了关于队列截断场景的假设。然而,这些假设在其他场景(如检索通道选择和预测模型选择)中不成立。此外,现有研究忽略了请求在不同阶段之间的状态转移过程,限制了其方法的有效性。本文提出了一种基于强化学习(RL)的多阶段计算分配方法(RL-MPCA),旨在CR限制下最大化总业务收益。RL-MPCA将CR分配问题建模为弱耦合MDP问题,并使用基于RL的方法求解。具体来说,RL-MPCA设计了一种新颖的深度Q网络以适应各种CR分配场景,并通过引入多个自适应拉格朗日乘子(adaptive-λ)来校准Q值,以避免违反全局CR约束。最后,在离线模拟环境和在线真实推荐系统上的实验验证了我们方法的有效性。

关键词

引用

@article{arxiv.2401.01369,
  title  = {RL-MPCA: A Reinforcement Learning Based Multi-Phase Computation Allocation Approach for Recommender Systems},
  author = {Jiahong Zhou and Shunhui Mao and Guoliang Yang and Bo Tang and Qianlong Xie and Lebin Lin and Xingxing Wang and Dong Wang},
  journal= {arXiv preprint arXiv:2401.01369},
  year   = {2024}
}

备注

11 pages, 7 figures, published to Proceedings of the ACM Web Conference 2023