中文

序列矩阵补全

信息检索 2017-10-24 v1 机器学习 机器学习

摘要

我们提出了一种用于推荐系统场景下的序列矩阵补全新算法,其中矩阵的第 (i,j)(i,j) 个条目对应于用户 ii 对产品 jj 的评分。该算法的目标是为用户-产品对的推荐提供一个序列策略,使得在有限时间范围后能获得尽可能高的评分。该算法使用一个 Gamma 过程因子模型,并结合两种以后验为中心的 bandit 策略:Thompson 采样和信息导向采样。虽然 Thompson 采样在模拟中表现出有竞争力的性能,但信息导向采样通过基于期望奖励与信息增益度量之间的比率来做出推荐,获得了最先进的性能。据我们所知,这是信息导向采样在大型真实数据集上的首次实现。这一方法为近期关于 bandit 方法用于协同过滤的研究做出了贡献,这些研究包括 Kawale et al. (2015)、Li et al. (2010)、Bresler et al. (2014)、Li et al. (2016)、Deshpande & Montanari (2012) 以及 Zhao et al. (2013)。正如 Kawale et al. (2015) 和 Zhao et al. (2013) 所指出的,本文的设置对在有限时间范围后界定遗憾值提出了重大挑战。我们结合更简单的带辅助信息的 bandit 模型(如线性或高斯过程 bandit)讨论了这些挑战,并希望本文展示的实验能激发进一步的理论保证研究。

关键词

引用

@article{arxiv.1710.08045,
  title  = {Sequential Matrix Completion},
  author = {Annie Marsden and Sergio Bacallado},
  journal= {arXiv preprint arXiv:1710.08045},
  year   = {2017}
}

备注

10 pages, 6 figures