中文

基于深度神经网络的音乐潜在嵌入建模

声音 2017-05-16 v1 机器学习

摘要

尽管数字音乐内容的数据量与异构性均十分巨大,构建推荐或搜索系统以将这些内容呈现给用户或消费者群体已变得愈发重要且便捷。多数推荐模型分为两大类:基于协同过滤的方法与基于内容的方法。协同过滤方法的具体变体饱受所谓的“冷启动”与“长尾”问题困扰,即缺乏足够的用户交互数据来揭示用户对内容的意见或偏好,且存在向热门内容倾斜的失真。基于内容的方法有时受限于可用内容数据的丰富程度,导致推荐结果严重偏倚且粗糙。近年来,深度神经网络在大规模图像与视频识别中取得了巨大成功。本文提出并试验使用深度卷积神经网络来模仿人脑在不同时间尺度上处理听觉信号(如音乐、语音等)中层次结构的方式。该方法可用于基于从音乐原始声波中提取的声学超图像来发现音乐的潜在因子模型。这些潜在嵌入既可作为特征输入后续模型(如协同过滤),也可用于构建歌曲间的相似度度量,或基于训练标签(如流派、情绪、情感等)对音乐进行分类。

关键词

引用

@article{arxiv.1705.05229,
  title  = {Modeling of the Latent Embedding of Music using Deep Neural Network},
  author = {Zhou Xing and Eddy Baik and Yan Jiao and Nilesh Kulkarni and Chris Li and Gautam Muralidhar and Marzieh Parandehgheibi and Erik Reed and Abhishek Singhal and Fei Xiao and Chris Pouliot},
  journal= {arXiv preprint arXiv:1705.05229},
  year   = {2017}
}