中文

利用音频与歌词内容的音乐情感识别多模态方法

音频与语音处理 2018-11-15 v1 计算与语言 计算机视觉与模式识别 多媒体 声音

摘要

我们提出MoodNet——一种基于深度卷积神经网络的架构,用于在给定音乐的音频与歌词内容时有效预测其关联情感。我们评估了由不同数量的二维卷积与下采样层以及后续全连接层组成的不同架构。我们使用梅尔谱图表示音频内容,并使用词嵌入——具体为100维词向量——表示由歌词所表征的文本内容。我们将来自两种模态的输入数据送入我们的MoodNet架构。随后两种模态的输出被融合为一个全连接层,并使用softmax分类器预测情感类别。以F1-score为度量,我们的结果显示MoodNet在我们实验的两个数据集——MIREX多模态数据集与Million Song Dataset上表现优异。我们的实验反映了更复杂模型在更多训练数据下表现更好的假设。我们还观察到歌词作为一种表达更充分的模态优于音频,并得出结论:相较于使用单一模态作为输入,结合并利用来自多模态的特征进行预测任务可带来更优性能。

关键词

引用

@article{arxiv.1811.05760,
  title  = {A Multimodal Approach towards Emotion Recognition of Music using Audio and Lyrical Content},
  author = {Aniruddha Bhattacharya and K. V. Kadambari},
  journal= {arXiv preprint arXiv:1811.05760},
  year   = {2018}
}

备注

6 pages