基于 Bandit 建模的马尔可夫决策过程用于线性流中的序贯决策
机器学习
2022-03-18 v2 机器学习
摘要
在营销中,我们有时需要按顺序为多个页面推荐内容。与一般的序贯决策过程不同,这些用例具有更简单的流程:客户在每页看到推荐内容后,只能给出向前推进或退出流程的反馈,直至终止状态。我们将此类问题称为线性流中的序贯决策(sequential decision making in linear-flow)。我们提出将该问题表述为一个带 Bandit 的 MDP(Markov Decision Process,马尔可夫决策过程),其中使用 Bandit 来建模转移概率矩阵。在推荐时,我们使用 Thompson 采样(TS)对转移概率进行采样,并通过精确动态规划以解析解分配最优动作序列。我们对问题的表述方式使我们能够利用 TS 在探索与利用间平衡的高效性,以及 Bandit 在建模动作不相容性方面的便利性。在仿真研究中,我们观察到所提出的带 Bandit 的 MDP 算法优于带 -greedy 及递减 的 Q-learning、独立 Bandit 和交互 Bandit。我们还发现所提算法在面对跨页相互依赖强度变化时的表现最为稳健。
引用
@article{arxiv.2107.00204,
title = {Markov Decision Process modeled with Bandits for Sequential Decision Making in Linear-flow},
author = {Wenjun Zeng and Yi Liu},
journal= {arXiv preprint arXiv:2107.00204},
year = {2022}
}
备注
Accepted by 2021 KDD Multi-Armed Bandits and Reinforcement Learning Workshop: https://sites.google.com/view/marble-kdd