中文

高维线性多臂老虎机与推荐系统

机器学习 2013-01-10 v1 机器学习

摘要

大量在线服务提供自动推荐,以帮助用户浏览庞大的物品集合。新物品(产品、视频、歌曲、广告)是根据用户的历史记录以及(如有)其人口统计特征进行推荐的。推荐必须满足双重目标:既帮助用户探索可用物品空间,又允许系统探测用户偏好。我们使用线性参数化的多臂老虎机对这种权衡进行建模,提出了一种策略,并证明了在数据匮乏(高维)机制下累积“奖励”的上下界,它们在常数因子内重合。先前关于线性老虎机的工作主要集中在数据丰富(低维)机制,并使用累积“风险”作为评价指标。针对这种数据丰富机制,我们对策略进行了简单修改,在更严格的几何假设下实现了接近最优的风险性能。我们在 Netflix 和 MovieLens 数据集上测试了用于建立可实现性的方案(及其变体),结果与我们所发展理论的定性预测吻合良好。

关键词

引用

@article{arxiv.1301.1722,
  title  = {Linear Bandits in High Dimension and Recommendation Systems},
  author = {Yash Deshpande and Andrea Montanari},
  journal= {arXiv preprint arXiv:1301.1722},
  year   = {2013}
}

备注

21 pages, 4 figures