中文

深度强化学习用于 Pinterest 广告推荐系统中的排序效用调优

机器学习 2025-09-08 v1

摘要

广告推荐系统中排序效用函数——将各种业务目标的预测结果线性组合——在平衡平台、广告主和用户之间价值方面发挥着核心作用。传统的手动调优虽然简单直观,但常常产生次优结果,原因在于其调优目标不够原则、参数组合庞大且缺乏针对季节性变化的个人化和自适应能力。本文提出了一种通用的深度强化学习框架,用于个人化效用调优(DRL-PUT),以解决广告推荐系统中多目标优化的挑战。我们的主要贡献包括:1)将问题表述为强化学习任务:给定广告请求的状态,预测用于最大化预定义奖励的 optimal 超参数。2)开发一种直接通过在线服务日志学习 optimal 策略模型的方法,无需估计价值函数——后者因即时奖励的高方差和分布不平衡而天然具有挑战性。我们通过 Pinterest 广告推荐系统中的在线 A/B 实验评估了 DRL-PUT。相较于基线的手动效用调优方法,DRL-PUT 在受试组中将点击率提升了 9.7%,长点击率提升了 7.7%。我们对不同奖励定义的影响进行了详细的消融研究,并分析了所学习策略模型的个人化方面。

关键词

引用

@article{arxiv.2509.05292,
  title  = {Deep Reinforcement Learning for Ranking Utility Tuning in the Ad Recommender System at Pinterest},
  author = {Xiao Yang and Mehdi Ben Ayed and Longyu Zhao and Fan Zhou and Yuchen Shen and Abe Engle and Jinfeng Zhuang and Ling Leng and Jiajing Xu and Charles Rosenberg and Prathibha Deshikachar},
  journal= {arXiv preprint arXiv:2509.05292},
  year   = {2025}
}