面向大规模推荐问题的级联bandits
机器学习
2016-07-01 v2 机器学习
摘要
大多数推荐系统推荐一个项目列表。用户从该列表首项至末项依次检查,通常选择第一个有吸引力的项目而不再查看其余项。此类用户行为可由级联模型(cascade model)建模。本工作中,我们研究级联bandits(cascading bandits),即级联模型的在线学习变体,其目标是从包含个候选项目的大集合中推荐个最具吸引力的项目。我们提出两种基于线性泛化思想求解该问题的算法。我们方法的核心思想是从项目特征中学习其吸引概率的预测器,而非如现有工作那样独立学习每个项目的吸引概率。这产生了实用的学习算法,其后悔(regret)不依赖于项目数量。我们给出了其中一种算法的后悔界,并在一系列推荐问题上对另一种进行了综合评估。该算法表现良好,优于所有基线。
引用
@article{arxiv.1603.05359,
title = {Cascading Bandits for Large-Scale Recommendation Problems},
author = {Shi Zong and Hao Ni and Kenny Sung and Nan Rosemary Ke and Zheng Wen and Branislav Kveton},
journal= {arXiv preprint arXiv:1603.05359},
year = {2016}
}
备注
Accepted to UAI 2016