用于音乐情感识别的堆叠卷积与循环神经网络
声音
2017-06-09 v1 机器学习
摘要
本文研究在二维效价-唤醒度 (V-A) 情感空间中对音乐曲目进行情感识别。我们提出了一种基于卷积神经网络 (CNN) 和循环神经网络 (RNN) 的方法,与同一任务的最先进方法相比,其参数数量显著减少。我们使用一个 CNN 层,后接两个分别针对唤醒度和效价训练的 RNN 分支。该方法在 'MediaEval2015 emotion in music' 数据集上进行了评估。我们在唤醒度上取得了 0.202 的 RMSE,在效价上取得了 0.268 的 RMSE,这是该数据集上报告的最佳结果。
引用
@article{arxiv.1706.02292,
title = {Stacked Convolutional and Recurrent Neural Networks for Music Emotion Recognition},
author = {Miroslav Malik and Sharath Adavanne and Konstantinos Drossos and Tuomas Virtanen and Dasa Ticha and Roman Jarina},
journal= {arXiv preprint arXiv:1706.02292},
year = {2017}
}
备注
Accepted for Sound and Music Computing (SMC 2017)