面向多样化交互式推荐的Bandit学习
信息检索
2019-07-04 v1 机器学习
机器学习
摘要
支持用户与推荐系统之间交互的交互式推荐系统已引起越来越多的研究关注。以往方法主要关注优化推荐准确率,但通常忽略推荐结果的多样性,从而导致用户体验不佳。本文提出一种新颖的多样化推荐模型,称为多样化上下文组合Bandit(Diversified Contextual Combinatorial Bandit, DCB),用于带有用户隐式反馈的交互式推荐。具体而言,DCB在推荐过程中采用行列式点过程以提升推荐结果的多样性。为学习模型参数,提出了一种基于变分贝叶斯推断的Thompson采样型算法。此外,还提供了理论后悔分析以保证DCB的性能。在真实数据集上进行了大量实验以证明所提方法的有效性。
引用
@article{arxiv.1907.01647,
title = {Bandit Learning for Diversified Interactive Recommendation},
author = {Yong Liu and Yingtai Xiao and Qiong Wu and Chunyan Miao and Juyong Zhang},
journal= {arXiv preprint arXiv:1907.01647},
year = {2019}
}