具有弃用行为的多臂老虎机中的探索、利用与参与度
机器学习
2022-05-30 v1
摘要
多臂老虎机(MAB)是理解探索-利用权衡的经典模型。用于推荐系统的传统MAB模型假设用户在整个学习周期内停留在系统中。在诸如ALEKS的新在线教育平台或诸如TikTok和YouTube Shorts的新视频推荐系统中,用户停留在应用上的时间取决于所推荐内容的吸引力。若推荐项无法吸引用户,用户可能暂时离开系统。为理解这些系统中的探索、利用与参与度,我们提出一种新模型,称为MAB-A,其中“A”代表弃用(abandonment),且弃用概率取决于当前推荐项和用户的过往经验(称为状态)。我们提出两种算法,ULCB和KL-ULCB,二者均在前一推荐项被用户喜欢时进行更多探索(乐观),而在用户不喜欢前一推荐项时进行更少探索(悲观)。我们证明ULCB和KL-ULCB均实现对数后悔,,其中为访问次数(或轮次)。此外,KL-ULCB下的后悔界是渐近紧的。我们还将所提算法推广至一般状态设定。仿真结果证实了我们的理论分析,并表明所提算法的后悔显著低于传统UCB、KL-UCB及基于Q-learning的算法。
引用
@article{arxiv.2205.13566,
title = {Exploration, Exploitation, and Engagement in Multi-Armed Bandits with Abandonment},
author = {Zixian Yang and Xin Liu and Lei Ying},
journal= {arXiv preprint arXiv:2205.13566},
year = {2022}
}