中文

BCRLSP:一种用于序列定向促销的离线强化学习框架

机器学习 2022-07-19 v1 信息检索

摘要

我们利用离线强化学习(RL)模型,在存在预算约束的真实业务环境中进行序列定向促销。在我们的应用中,移动应用旨在通过向客户发送现金奖励来提升客户留存率,并在每个时间段控制此类现金奖励的成本。为实现多任务目标,我们提出预算约束强化学习序列促销(BCRLSP)框架,以确定发送给用户的现金奖励数额。我们首先利用 RL 模型找出最大化用户留存率的目标策略及关联的 Q 值。随后加入一个线性规划(LP)模型以满足促销成本的约束。我们在预算约束下通过最大化从 RL 模型学到的动作 Q 值来求解 LP 问题。在部署期间,我们将离线 RL 模型与 LP 模型结合,以在预算约束下生成鲁棒策略。通过在线与离线实验,我们展示了方法的有效性:BCRLSP 相比多种基线实现了更高的长期客户留存率和更低的成本。借助近实时成本控制方法的优势,所提框架可轻松适应具有噪声行为策略的数据和/或满足灵活预算约束。

关键词

引用

@article{arxiv.2207.07790,
  title  = {BCRLSP: An Offline Reinforcement Learning Framework for Sequential Targeted Promotion},
  author = {Fanglin Chen and Xiao Liu and Bo Tang and Feiyu Xiong and Serim Hwang and Guomian Zhuang},
  journal= {arXiv preprint arXiv:2207.07790},
  year   = {2022}
}

备注

8 pages, DRL4IR@SIGIR