中文

展示广告中基于无模型强化学习的预算约束竞价

人工智能 2018-10-24 v6

摘要

实时竞价(RTB)是在线展示广告中的重要机制,其中为每个页面浏览设置合适出价对良好的营销结果起着关键作用。预算约束竞价是 RTB 中的典型场景,广告主希望在预设预算约束下最大化获胜曝光的总价值。然而,由于拍卖环境的复杂性和易变性,最优竞价策略难以推导。为应对这些挑战,本文将预算约束竞价建模为马尔可夫决策过程,并提出了一种无模型强化学习框架来解决该优化问题。我们的分析表明,在关键资源约束下,来自环境的即时奖励具有误导性。因此,我们创新了一种针对带约束强化学习问题的奖励函数设计方法。基于新的奖励设计,我们采用深度神经网络学习适当的奖励,从而有效学习最优策略。不同于先前基于模型的工作存在可扩展性问题,我们的框架易于部署在大规模工业应用中。实验评估证明了我们的框架在大规模真实数据集上的有效性。

关键词

引用

@article{arxiv.1802.08365,
  title  = {Budget Constrained Bidding by Model-free Reinforcement Learning in Display Advertising},
  author = {Di Wu and Xiujun Chen and Xun Yang and Hao Wang and Qing Tan and Xiaoxun Zhang and Jian Xu and Kun Gai},
  journal= {arXiv preprint arXiv:1802.08365},
  year   = {2018}
}

备注

In The 27th ACM International Conference on Information and Knowledge Management (CIKM 18), October 22-26, 2018, Torino, Italy. ACM, New York, NY, USA, 9 pages