通过分形扩展构建可扩展的逼真推荐系统数据集
信息检索
2019-02-22 v3 机器学习
机器学习
摘要
推荐系统研究目前面临学术数据集规模与工业级生产系统规模之间的脱节。为弥合这一差距,我们提出通过扩展已有的公开数据集来生成更大规模的用户/物品交互数据。用户/物品关联矩阵将给定平台上用户与物品之间的交互记录为一个大型稀疏矩阵,其行对应用户、列对应物品。我们的技术在扩展此类矩阵的行数(用户)、列数(物品)和非零值(交互)数量的同时,保留了关键的高阶统计特性。我们将Kronecker图理论适配于用户/物品关联矩阵,并证明相应的分形扩展保留了用户参与度、物品热度以及用户/物品交互矩阵奇异值谱的胖尾分布。保留这些特性是构建大型逼真合成数据集的关键,而此类数据集可可靠地用于推荐系统及其训练系统的基准测试。我们提供了生成此类扩展的算法,并将其应用于MovieLens 2000万数据集(包含13.8万用户对2.7万部电影的2000万条评分)。所得扩展数据集的较小版本拥有100亿条评分、86.4万物品和200万用户,并可按需放大或缩小。较大版本则包含6550亿条评分、700万物品和1700万用户。
引用
@article{arxiv.1901.08910,
title = {Scalable Realistic Recommendation Datasets through Fractal Expansions},
author = {Francois Belletti and Karthik Lakshmanan and Walid Krichene and Yi-Fan Chen and John Anderson},
journal= {arXiv preprint arXiv:1901.08910},
year = {2019}
}