中文

基于离线鲁棒强化学习的会话级动态广告加载优化

机器学习 2025-01-13 v1

摘要

会话级动态广告加载优化旨在通过动态平衡用户体验质量和广告变现,在用户在线会话期间实时个性化投放广告的密度和类型。传统的基于因果学习的方法在应对关键技术挑战时存在困难,特别是在处理混杂偏差和分布偏移方面。在本文中,我们开发了一个基于离线深度 Q 网络(DQN)的框架,该框架有效缓解了动态系统中的混杂偏差,并且与最佳的基于因果学习的生产基线相比,展现出超过 80% 的离线增益。此外,为了提高框架应对意外分布偏移的鲁棒性,我们进一步采用一种新颖的离线鲁棒决斗 DQN 方法增强了该框架。随着扰动增加,该方法在多个 OpenAI-Gym 数据集上实现了更稳定的奖励,并在真实世界的广告投放数据上提供了额外的 5% 离线增益。该方法已部署在多个生产系统中,并取得了巨大的顶层收益。发布后的在线 A/B 测试表明,在互动-广告得分权衡效率方面实现了两位数的提升,显著增强了我们平台同时服务消费者和广告商的能力。

关键词

引用

@article{arxiv.2501.05591,
  title  = {Session-Level Dynamic Ad Load Optimization using Offline Robust Reinforcement Learning},
  author = {Tao Liu and Qi Xu and Wei Shi and Zhigang Hua and Shuang Yang},
  journal= {arXiv preprint arXiv:2501.05591},
  year   = {2025}
}

备注

Will appear in KDD 2025