中文

面向有反应用户的最优推荐:一类部分可观测马尔可夫决策过程(POMDP)的在线学习

机器学习 2016-03-31 v1

摘要

我们描述并研究了一种自动化在线推荐系统(AORS)的模型,其中用户偏好可能随时间变化,并且也可能依赖于过去推荐和播放的历史。与现有推荐系统模型相比,使该模型更真实的三个关键特征是:(1) 用户偏好本质上是潜在的,(2) 当前推荐会影响未来偏好,(3) 它允许开发具有可证明性能保证的学习算法。该问题被表述为针对给定用户的平均代价不安分多臂老虎机,其中每个内容项对应一个独立的部分可观测马尔可夫决策过程(POMDP)。我们分析了单臂的 POMDP,描述了其结构性质,并刻画了其最优策略。然后,我们开发了一种基于汤普森采样的在线强化学习算法,以从用户对连续推荐的二元响应中学习模型参数并优化效用。接着我们分析了该学习算法的性能并刻画了遗憾值。文中还给出了说明性的数值结果以及向不安分隐马尔可夫多臂老虎机问题扩展的方向。

关键词

引用

@article{arxiv.1603.09233,
  title  = {Optimal Recommendation to Users that React: Online Learning for a Class of POMDPs},
  author = {Rahul Meshram and Aditya Gopalan and D. Manjunath},
  journal= {arXiv preprint arXiv:1603.09233},
  year   = {2016}
}

备注

8 pages, submitted to conference