中文

Yelp数据集挑战赛:评论评分预测

计算与语言 2016-05-19 v1 信息检索 机器学习

摘要

诸如TripAdvisor和Yelp之类的评论网站允许用户为各种商家、产品和服务发布在线评论,且最近已被证明对消费者购物行为有显著影响。一条在线评论通常由自由文本和五分制星级评分组成。在给定用户对某产品的文本评论的情况下,预测该用户对该产品的星级评分的问题被称为评论评分预测,近来已成为机器学习中一个流行但困难的问题。在本文中,我们将评论评分预测视为一个多类分类问题,并通过组合四种特征提取方法((i) unigrams、(ii) bigrams、(iii) trigrams 和 (iv) 潜在语义索引)与四种机器学习算法((i) 逻辑回归、(ii) 朴素贝叶斯分类、(iii) 感知机 和 (iv) 线性支持向量分类)构建了十六种不同的预测模型。我们分析了这十六种模型中每一种的性能,以得出从评论预测评分的最佳模型。我们使用Yelp提供的数据集来训练和测试这些模型。

关键词

引用

@article{arxiv.1605.05362,
  title  = {Yelp Dataset Challenge: Review Rating Prediction},
  author = {Nabiha Asghar},
  journal= {arXiv preprint arXiv:1605.05362},
  year   = {2016}
}