中文

基于模型的约束MDP用于序列激励营销中的预算分配

人工智能 2023-03-03 v1

摘要

序列激励营销是线上企业获取客户、提升忠诚度并促进销售的重要手段。然而,文献中较少研究如何在预算约束下有效分配激励以最大化回报(如业务目标)。该问题在技术上存在挑战:1)分配策略须利用历史记录数据学习,其本质为反事实的;2)在部署至线上系统前需同时评估最优性与可行性(即成本不可超预算)。本文将问题建模为约束马尔可夫决策过程(CMDP)。为利用记录的反事实数据求解CMDP,我们提出一种结合二分搜索与基于模型规划的高效学习算法。首先,通过拉格朗日松弛将CMDP转化为其对偶问题,并证明其对偶变量具有单调性。进而,我们表明对偶问题可通过策略学习求解,最优对偶变量借助单调性经二分搜索高效获得。最后,我们证明基于模型的规划可加速联合优化过程,而无需为每个对偶变量重训策略。在合成与真实营销数据集上的实证结果验证了方法有效性。

关键词

引用

@article{arxiv.2303.01049,
  title  = {Model-based Constrained MDP for Budget Allocation in Sequential Incentive Marketing},
  author = {Shuai Xiao and Le Guo and Zaifan Jiang and Lei Lv and Yuanbo Chen and Jun Zhu and Shuang Yang},
  journal= {arXiv preprint arXiv:2303.01049},
  year   = {2023}
}

备注

Published at CIKM '19: Proceedings of the 28th ACM International Conference on Information and Knowledge Management