亚马逊图书评分预测与推荐模型
信息检索
2023-10-06 v1 分布式、并行与集群计算
摘要
本文使用亚马逊的数据集来预测亚马逊网站上所列图书的评分。作为该项目的一部分,我们预测了图书的评分,并构建了一个推荐簇。该推荐簇基于数据集中的列值(例如类别、描述、作者、价格、评论等)提供推荐图书。本文给出了处理大数据文件、数据工程、构建模型并提供预测的完整流程。这些模型利用多种 PySpark 机器学习 API 预测图书评分列。此外,我们使用了超参数与参数调优。同时,采用交叉验证(Cross Validation)与训练验证切分(TrainValidationSplit)以实现泛化。最后,我们比较了二分类与多分类在准确率上的差异。我们将标签从多类转换为二分类,以观察两种分类之间是否存在差异。结果表明,二分类的准确率高于多分类。
引用
@article{arxiv.2310.03200,
title = {Amazon Books Rating prediction & Recommendation Model},
author = {Hsiu-Ping Lin and Suman Chauhan and Yougender Chauhan and Nagender Chauhan and Jongwook Woo},
journal= {arXiv preprint arXiv:2310.03200},
year = {2023}
}
备注
5 pages, 4 figures, 8 tables