营销疲劳下序列选择_bandit问题的动态学习
机器学习
2019-03-21 v1 机器学习
摘要
受过度接触不想要的营销活动会导致客户不满这一现象的启发,我们考虑这样一个场景:平台向用户推送一系列消息,并在用户因营销疲劳而放弃平台时受到惩罚。我们提出一种新颖的序列选择模型来刻画平台与用户之间发生的多次交互:收到消息后,用户决定采取以下三种行动之一:接受消息、跳过并接收下一条消息,或放弃平台。基于用户反馈,平台动态学习用户的放弃分布及其对消息的估值,以确定序列长度与消息顺序,同时最大化长度为 T 的时间范围内的累积收益。我们将此在线学习任务称为序列选择_bandit问题。对于离线组合优化问题,我们证明存在高效的多项式时间算法。对于在线问题,我们提出一种平衡探索与利用的算法,并刻画其后悔界。最后,我们展示了如何通过用户上下文扩展该模型以纳入个性化。
引用
@article{arxiv.1903.08193,
title = {Dynamic Learning of Sequential Choice Bandit Problem under Marketing Fatigue},
author = {Junyu Cao and Wei Sun},
journal= {arXiv preprint arXiv:1903.08193},
year = {2019}
}