RLTP:面向预加载广告延迟曝光建模的强化学习步调控制
信息检索
2024-06-18 v4
摘要
为了提高品牌知名度,许多广告主与广告平台签订合同购买流量,然后将广告投放给目标受众。在整个投放期内,广告主通常期望广告获得一定的曝光量,同时也期望投放效果尽可能好(例如获得高点击率)。广告平台采用步调控制算法,通过实时调整对流量的选择概率来满足这些需求。然而,投放过程也受到发布方策略的影响,这是广告平台无法控制的。预加载是许多类型广告(如视频广告)广泛采用的策略,以确保流量请求后展示的响应时间合理,这导致了延迟曝光现象。传统的步调控制算法无法很好地处理预加载特性,因为它们依赖即时反馈信号,可能无法保证广告主的需求。本文聚焦于预加载广告曝光步调控制这一新研究问题,提出了 Reinforcement Learning To Pace 框架 RLTP。它学习一个步调控制智能体,在整个投放期内依次生成选择概率。为了联合优化曝光量和投放效果这两个目标,RLTP 采用定制的奖励估计器,以满足保证的曝光量,惩罚过量投放并最大化流量价值。在大规模工业数据集上的实验验证了 RLTP 大幅优于基线步调控制算法。我们已将 RLTP 框架部署到我们的在线广告平台,结果表明它在投放完成率和点击率等核心指标上实现了显著提升。
引用
@article{arxiv.2302.02592,
title = {RLTP: Reinforcement Learning to Pace for Delayed Impression Modeling in Preloaded Ads},
author = {Penghui Wei and Yongqiang Chen and Shaoguo Liu and Liang Wang and Bo Zheng},
journal= {arXiv preprint arXiv:2302.02592},
year = {2024}
}
备注
KDD 2023 (Applied Data Science Track). The first two authors contributed equally