音乐流媒体会话数据集
信息检索
2020-10-16 v2 人机交互
机器学习
摘要
在线流媒体服务面临的许多重要机器学习问题的核心,是需要建模用户与其所接收内容的交互方式。遗憾的是,目前尚无可供研究者探索该主题的公开数据集。为推动此类研究,我们发布音乐流媒体会话数据集(MSSD),其包含1.6亿个收听会话及相关的用户行为。此外,我们为日志中涉及的约370万首独特音轨提供了音频特征与元数据。这是目前公开可用的最大的此类音轨元数据集合。该数据集支持对重要问题的研究,包括如何建模流媒体中的用户收听与交互行为,以及音乐信息检索(MIR)和基于会话的序列推荐。另外,一部分会话是通过均匀随机推荐设置收集的,使其可用于此类序列推荐的反事实评估。最后,我们提供了用户行为分析,并提出了可利用该数据集解决的进一步研究问题。
引用
@article{arxiv.1901.09851,
title = {The Music Streaming Sessions Dataset},
author = {Brian Brost and Rishabh Mehrotra and Tristan Jehan},
journal= {arXiv preprint arXiv:1901.09851},
year = {2020}
}
备注
Web conference 2019 version with updated link to dataset