中文

推荐系统的差分数据分析

信息检索 2013-10-04 v1

摘要

我们提出了表征哪些数据对推荐系统重要而哪些不重要的技术。重要数据是指对推荐算法准确性贡献最大的数据,而较不重要的数据对准确性的贡献较小,甚至会降低准确性。表征数据的重要性有两个潜在的直接益处:(1) 提高隐私性;(2) 降低数据管理成本,包括存储成本。就隐私而言,我们利用现有的数据混淆技术,在相当的隐私水平下实现了更高的推荐准确性。就存储而言,我们的结果表明,我们可以大幅减少推荐数据,同时保持推荐准确性。我们的主要技术称为差分数据分析。其名称灵感来源于其他类型的差分分析,如差分功耗分析和差分密码分析,这些分析通过对略有不同的输入进行分析来获得洞察。在差分数据分析中,我们将数据分块,并比较存在或不存在每个块时的结果。我们展示了将差分数据分析应用于两个数据集和三种不同属性类型的结果。第一个属性称为用户困难度 (user hardship)。这是一个新颖的属性,特别适用于位置数据集,指示获取某个数据点的负担程度。第二和第三个属性更为标准:时间戳和用户评分。对于用户评分,我们证实了先前的工作,即对应于高和低用户评分的数据对推荐系统更为重要。

关键词

引用

@article{arxiv.1310.0894,
  title  = {Differential Data Analysis for Recommender Systems},
  author = {Richard Chow and Hongxia Jin and Bart Knijnenburg and Gokay Saldamli},
  journal= {arXiv preprint arXiv:1310.0894},
  year   = {2013}
}

备注

Extended version of RecSys 2013 paper