利用不平衡数据与分类代价矩阵预测电影偏好
信息检索
2018-12-07 v1 人工智能
摘要
在本文中,我们针对需要基于数据和分析方法来储备受欢迎电影并面向年轻人进行目标营销的中小企业(SMEs),提出了一种基于不平衡调查数据以及不等分类代价的电影类型推荐系统。该数据集维护了详细的个人资料作为预测变量,包括每位用户的人口统计、行为和偏好信息以及不平衡的类型偏好。这些预测变量不包括演员或导演等信息。本文应用 Gentle boost、Adaboost 和 Bagged tree 集成以及 SVM 机器学习算法,从一千条观测中学习分类,并在调整分类代价后预测电影类型偏好。所提出的推荐系统还选择重要预测变量以避免过拟合并缩短训练时间。本文比较了上述用于推荐不同电影类型的算法的测试误差。通过与其它 SOTA 推荐系统在精确率和召回率上的比较,也表明了预测能力。所提出的电影类型推荐系统解决了小数据集、不平衡响应和不相等分类代价等问题。
引用
@article{arxiv.1812.02529,
title = {Utilizing Imbalanced Data and Classification Cost Matrix to Predict Movie Preferences},
author = {Haifeng Wang},
journal= {arXiv preprint arXiv:1812.02529},
year = {2018}
}
备注
12 pages, 4 figures