基于邻居流行度的协同过滤分析
信息论
2016-11-18 v3 math.IT
摘要
本文分析了一种回答简单问题“你的朋友中什么最流行?”的协同过滤器。虽然这一基本原则在许多实际实现中似乎很普遍,但对其性能的理论分析似乎并不多。本文部分填补了这一空白。尽管近期关于该主题的工作(如低秩矩阵补全文献)考虑了恢复整个评分矩阵的误差概率,但我们考虑单个推荐中的误差概率(误码率,BER)。针对文献[1],[2]中引入的一个数学模型,我们在矩阵大小趋于无穷的极限下,确定了算法(命名为“朋友间流行度”,PAF)的三种运行状态。在样本数量大且自由度小(文中对模型精确定义)的状态下,渐近BER为零;在样本数量大且自由度大的状态下,渐近BER远离0和1/2(除特殊情况外精确确定);在样本数量小的状态下,算法失效。我们还给出了MovieLens和Netflix数据集的数值结果。我们结合理论结果讨论了经验性能,并与基于低秩矩阵补全的方法进行了比较。
引用
@article{arxiv.1006.1772,
title = {Analysis of a Collaborative Filter Based on Popularity Amongst Neighbors},
author = {Kishor Barman and Onkar Dabeer},
journal= {arXiv preprint arXiv:1006.1772},
year = {2016}
}
备注
47 pages. Submitted to IEEE Transactions on Information Theory (revised in July 2011). A shorter version would be presented at ISIT 2010