通过随机分形扩展扩展协同过滤数据集规模
机器学习
2019-05-27 v1 信息检索
机器学习
摘要
推荐系统研究存在学术数据集规模与工业生产系统规模之间的脱节。为弥合这一差距,我们提出通过扩展已有的公开数据集来生成大规模用户/物品交互数据集。我们的关键贡献是一种将用户/物品关联矩阵扩展至大量行(用户)、列(物品)和非零值(交互)的技术。所提方法改编自Kronecker图理论,以保留关键的高阶统计特性,如用户参与度的重尾分布、物品流行度以及用户/物品交互矩阵的奇异值谱。保留此类特性对于构建大型逼真合成数据集至关重要,后者可可靠地用于基准测试推荐系统及用于训练它们的系统。我们进一步将随机扩展算法应用于二值化的MovieLens 20M数据集,该数据集包含27K部电影与138K用户之间的20M次交互。所得扩展数据集具有1.2B评分、2.2M用户和855K物品,并可按比例放大或缩小。
引用
@article{arxiv.1905.09874,
title = {Scaling Up Collaborative Filtering Data Sets through Randomized Fractal Expansions},
author = {Francois Belletti and Karthik Lakshmanan and Walid Krichene and Nicolas Mayoraz and Yi-Fan Chen and John Anderson and Taylor Robie and Tayo Oguntebi and Dan Shirron and Amit Bleiwess},
journal= {arXiv preprint arXiv:1905.09874},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1901.08910