用于在线矩阵分解推荐的轮换线性_bandit算法
信息检索
2018-10-23 v1 机器学习
机器学习
摘要
我们考虑在线设置中的在线协同过滤问题,其中随时间向用户推荐物品。在每个时间步,用户(由环境选择)消费一个物品(由智能体选择)并对所选物品提供评分。在本文中,我们提出了一种结合线性 bandit 与交替最小二乘的在线矩阵分解推荐新算法。在此公式中,bandit 反馈等于最佳物品与所选物品评分之差。我们使用累积遗憾和平均累积 NDCG 随时间评估所提算法的性能。在三个合成数据集以及三个用于在线协同过滤的真实数据集上的仿真结果表明,所提算法相对于两种最先进的在线算法具有优越性能。
引用
@article{arxiv.1810.09401,
title = {Alternating Linear Bandits for Online Matrix-Factorization Recommendation},
author = {Hamid Dadkhahi and Sahand Negahban},
journal= {arXiv preprint arXiv:1810.09401},
year = {2018}
}