两代人时期的IMDb数据,1979至2019年;第一部分,数据集介绍与初步分析
计算机与社会
2020-09-08 v3
摘要
“IMDb”作为一个用户调控且访问量最大的门户之一,提供了创建庞大数据库的机会。对互联网电影数据库(IMDb)上信息的分析,无论是与电影相关的还是用户提供的,将有助于揭示每部电影成功路径中的决定性因素。由于感到缺乏综合数据集,我们决心利用统计方法与机器学习模型创建一个简明数据集以供后续分析;它包含IMDb上提供的各类信息,如评分数据、类型、演职人员、MPAA评级证书、家长指南详情、相关电影信息、海报等,涵盖超过7.9万部标题,是迄今最大的数据集。本文是旨在上述目标的一系列论文中的第一篇,通过对所创建数据集的描述以及初步分析,考察了数据中的一些趋势、IMDb评分的人口统计特征及其与类型、MPAA评级证书的关系。
引用
@article{arxiv.2005.14147,
title = {IMDb data from Two Generations, from 1979 to 2019; Part one, Dataset Introduction and Preliminary Analysis},
author = {M. Bahraminasr and A. Vafaei Sadr},
journal= {arXiv preprint arXiv:2005.14147},
year = {2020}
}
备注
12 pages, 9 figures