中文

针对 Pinterest 推荐系统的生产就绪 RL 框架:基于 Pareto 扫描的个人化效用调优

信息检索 2026-05-19 v1 机器学习

摘要

大规模推荐系统通过组合多个预测结果到单个效用得分中来编码多目标权衡。尽管该效用层可以独立于排序器更新,权重调优仍大多是手动进行的、全球性地应用、难以适应不断变化的环境和业务需求,以及在优先级变更时难以治理。我们提出 PRL-PUTS(Production-ready, ranker independent RL framework for Personalized Utility-weight Tuning with Pareto Sweeping),即生产就绪、独立于排序器的 RL 框架,用于个人化效用权重调优。我们将效用调优建模为一个一步、基于价值的 RL 问题:给定请求上下文,智能体选择一个效用权重向量,以重新加权排序器预测,从而最大化请求级别的参与度奖励。为便于在权衡谱系上可视化性能并允许决策者即时更新已部署的运营策略,我们采用推理时的 Pareto 前沿扫描,通过标量化参数产生一系列策略和实证的 Pareto 前沿,用作运营策略选择的治理工件。PRL-PUTS 可并行于排序推断运行,不会增加服务延迟。我们使用无偏探索日志进行离线分析,并在 Pinterest Homefeed 上进行在线实验,PRL-PUTS 相对于基准(如 +0.13% 的成功会话提升)实现了显著的参与度提升,这是用户参与度的核心指标。

关键词

引用

@article{arxiv.2605.16344,
  title  = {A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems},
  author = {Yichu Zhou and Mehdi Ben Ayed and Lin Yang and Jiacong He and Andreanne Lemay and Jiaye Wang and Jaewon Yang and Josie Zeng and Dhruvil Deven Badani and Yijie Dylan Wang and Jiajing Xu and Charles Rosenberg},
  journal= {arXiv preprint arXiv:2605.16344},
  year   = {2026}
}