DCM Bandits:基于多次点击的学习排序
机器学习
2016-06-02 v2 机器学习
摘要
搜索引擎向用户推荐一个网页列表。用户从该列表的第一页到最后一页依次检查,并点击所有有吸引力的页面,直到用户满意为止。用户的这种行为可以用依赖点击模型(dependent click model, DCM)来描述。我们提出了 DCM bandits,即 DCM 的一种在线学习变体,其目标是最大化推荐满意条目(如网页)的概率。我们学习问题的主要挑战在于,我们无法观察到哪个有吸引力的条目是令人满意的。我们提出了一种计算高效的学习算法 dcmKL-UCB 来解决我们的问题;在合理假设下推导了其遗憾(regret)的间隙依赖上界;并证明了直至对数因子的匹配下界。我们在合成和真实世界问题上评估了我们的算法,并表明即使我们的模型被错误指定,它也能表现良好。本工作提出了第一个实用且遗憾(regret)最优的在线算法,用于在级联式点击模型中进行具有多次点击的学习排序。
引用
@article{arxiv.1602.03146,
title = {DCM Bandits: Learning to Rank with Multiple Clicks},
author = {Sumeet Katariya and Branislav Kveton and Csaba Szepesvári and Zheng Wen},
journal= {arXiv preprint arXiv:1602.03146},
year = {2016}
}
备注
Proceedings of the 33rd International Conference on Machine Learning