中文

关于协同过滤数据集的采样

机器学习 2022-01-14 v1 信息检索

摘要

我们研究了数据集采样策略对推荐算法排序性能的实际影响。推荐系统通常在较大数据集的样本上训练和评估。样本常以朴素或临时方式获取:例如随机采样数据集,或选择具有大量交互的用户或物品。如我们所展示的,常用的数据采样方案会对算法性能产生显著影响。基于该观察,本文做出三项主要贡献:(1) 从算法与数据集特征(如稀疏性特征、序列动态等)角度刻画采样对算法性能的影响;(2) 设计 SVP-CF,一种针对数据的采样策略,旨在保留采样后模型的相对性能,尤其适用于长尾交互数据;(3) 开发预言机 Data-Genie,可为给定数据集建议最有可能保留模型性能的采样方案。Data-Genie 的主要好处是使推荐系统实践者能够快速原型化并比较各种方法,同时确信一旦算法在完整数据上重新训练并部署,算法性能将得以保留。详细实验表明,使用 Data-Genie,我们可以在相同性能水平下比任何采样策略多丢弃至多 5 倍的数据。

关键词

引用

@article{arxiv.2201.04768,
  title  = {On Sampling Collaborative Filtering Datasets},
  author = {Noveen Sachdeva and Carole-Jean Wu and Julian McAuley},
  journal= {arXiv preprint arXiv:2201.04768},
  year   = {2022}
}

备注

9 pages, 4 figures, accepted for publication at WSDM '22. arXiv admin note: substantial text overlap with arXiv:2107.04984