基于最大熵强化学习的出价优化
机器学习
2021-10-12 v1 人工智能
计算机科学与博弈论
摘要
实时竞价(RTB)已成为在线广告的关键方式。在 RTB 中,广告主可参与竞价广告展示以投放其广告。广告主根据其竞价策略确定每次展示的出价价格。因此,良好的竞价策略可帮助广告主提升成本效率。本文关注在 RTB 中使用强化学习(RL)优化单一广告主的竞价策略。遗憾的是,由于 RTB 环境高度动态,在展示粒度上通过 RL 优化竞价策略具有挑战性。本文中,我们首先利用广泛接受的线性竞价函数计算每次展示的基础价格,并通过源自 RTB 拍卖环境的可变调整因子对其进行优化,以避免直接优化每次展示的出价价格。具体而言,我们使用最大熵 RL 算法(Soft Actor-Critic)在展示粒度上优化调整因子生成策略。最后,在公开数据集上的实证研究表明,所提出的竞价策略相较基线具有更优性能。
引用
@article{arxiv.2110.05032,
title = {Bid Optimization using Maximum Entropy Reinforcement Learning},
author = {Mengjuan Liu and Jinyu Liu and Zhengning Hu and Yuchen Ge and Xuyun Nie},
journal= {arXiv preprint arXiv:2110.05032},
year = {2021}
}