中文

面向推荐系统的印度地区电影数据集

信息检索 2018-01-16 v1 人工智能

摘要

印度地区电影数据集是首个包含印度地区电影、用户及其评分的数据库。它涵盖属于18种不同印度地区语言的电影,以及具有不同人口统计特征的用户元数据。通过该数据集,捕捉到了印度地区电影的多样性及其庞大的观众群。我们使用一些监督与无监督协同过滤技术(如概率矩阵分解、矩阵补全、盲压缩感知等)分析了包含约10K条评分、919名用户与2,851部电影的数据集。该数据集包含用户的年龄、职业、家乡所在州与已知语言等元数据,也包含电影的流派、语言、上映年份与演员等元数据。印度拥有广泛的观众基础,每年大量电影上映及巨大的票房收入便印证了这一点。该数据集可用于为尚不存在的印度用户与地区电影设计推荐系统。数据集可从\href{https://goo.gl/EmTPv6}{https://goo.gl/EmTPv6}下载。

关键词

引用

@article{arxiv.1801.02203,
  title  = {Indian Regional Movie Dataset for Recommender Systems},
  author = {Prerna Agarwal and Richa Verma and Angshul Majumdar},
  journal= {arXiv preprint arXiv:1801.02203},
  year   = {2018}
}

备注

7 pages, 8 figures, open-source Indian movie rating dataset, metadata of movies and users