基于课程引导贝叶斯强化学习的 ROI 约束竞价
机器学习
2022-07-19 v5 人工智能
摘要
实时竞价(RTB)是现代在线广告系统中的重要机制。广告主在 RTB 中采用竞价策略,在各种财务要求(尤其是投资回报率(ROI)约束)下优化其广告效果。在序列竞价过程中 ROI 呈非单调变化,并常导致约束满足与目标优化之间的跷跷板效应。尽管现有部分方法在静态或缓慢变化的广告市场中表现良好,但由于其无法在非平稳与部分可观测环境下自适应地平衡约束与目标,它们难以推广到具有 ROI 约束的高度动态广告市场。本文专注于非平稳市场中的 ROI 约束竞价。基于部分可观测约束马尔可夫决策过程,我们的方法利用无额外权衡参数的指示增强奖励函数,并提出了课程引导贝叶斯强化学习(CBRL)框架,以在非平稳广告市场中自适应控制约束-目标权衡。在大规模工业数据集上针对两种问题设定的大量实验表明,CBRL 在分布内与分布外数据场景下均具有良好泛化性,并具备更优的学习效率与稳定性。
引用
@article{arxiv.2206.05240,
title = {ROI-Constrained Bidding via Curriculum-Guided Bayesian Reinforcement Learning},
author = {Haozhe Wang and Chao Du and Panyan Fang and Shuo Yuan and Xuming He and Liang Wang and Bo Zheng},
journal= {arXiv preprint arXiv:2206.05240},
year = {2022}
}
备注
Accepted by SIGKDD 2022