中文

混合与延迟奖励下基于强化学习的增量竞价

机器学习 2023-01-18 v2 计算机科学与博弈论

摘要

增量(incrementality)用于衡量向潜在客户(例如互联网平台中的用户)展示广告而非不展示广告的因果效应,是在线广告平台中广告主的核心关注对象。本文研究广告主如何以在线方式学习优化竞价序列,且事先不知晓增量参数。我们将该问题的离线版本表述为一个具有特殊结构的情节式马尔可夫决策过程(MDP),并针对其在线学习对应问题,提出一种新颖的强化学习(RL)算法,其 regret 至多为 O~(H2T)\widetilde{O}(H^2\sqrt{T}),该界依赖于轮数 HH 与情节数 TT,但不依赖于动作数(即可能的出价数)。我们的学习问题与标准 RL 问题的一个根本区别在于:来自转化增量的已实现奖励反馈是混合且延迟的。为应对此困难,我们提出并分析了一种新颖的成对矩匹配算法来学习转化增量,我们相信其具有独立的兴趣价值。

关键词

引用

@article{arxiv.2206.01293,
  title  = {Incrementality Bidding via Reinforcement Learning under Mixed and Delayed Rewards},
  author = {Ashwinkumar Badanidiyuru and Zhe Feng and Tianxi Li and Haifeng Xu},
  journal= {arXiv preprint arXiv:2206.01293},
  year   = {2023}
}