中文

面向赞助搜索实时竞价深度强化学习

人工智能 2018-03-02 v1

摘要

竞价优化是在线广告中最关键的问题之一。赞助搜索(SS)拍卖由于用户查询行为的随机性和平台特性,通常采用关键词级别的竞价策略。相比之下,展示广告(DA)作为一种相对简单的拍卖场景,已利用实时竞价(RTB)提升了广告主的效果。本文研究赞助搜索拍卖中的 RTB 问题,称为 SS-RTB。由于用户查询行为的随机性以及基于广告多个关键词的更复杂竞价策略,SS-RTB 具有更为复杂的动态环境。以往大多数针对 DA 的方法无法适用。我们提出了一种强化学习(RL)方案来处理这一复杂动态环境。尽管已有一些 RL 方法被提出用于在线广告,但它们都未能解决“环境变化”问题:状态转移概率在两天之间会发生变化。受观察到两天拍卖序列在适当聚合层级上共享相似转移模式的启发,我们在拍卖数据的小时聚合层级上构建了一个鲁棒的 MDP 模型,并提出了一种用于 SS-RTB 的模型控制(control-by-model)框架。我们不直接生成出价,而是为每小时的曝光决定一个竞价模型并据此执行实时竞价。我们还将该方法扩展以处理多智能体问题。我们在阿里巴巴的电商搜索拍卖平台上部署了 SS-RTB 系统。离线评估与在线 A/B 测试的经验实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.1803.00259,
  title  = {Deep Reinforcement Learning for Sponsored Search Real-time Bidding},
  author = {Jun Zhao and Guang Qiu and Ziyu Guan and Wei Zhao and Xiaofei He},
  journal= {arXiv preprint arXiv:1803.00259},
  year   = {2018}
}