中文

音乐中的多模态:基于高层音频特征与歌词的音乐情感预测

声音 2023-02-28 v1 计算与语言 多媒体 音频与语音处理

摘要

本文旨在检验用于音乐情感识别(MER)的多模态方法是否比基于高层歌曲特征和歌词的单模态方法表现更好。我们使用从 Spotify API 获取的 11 个歌曲特征,结合包括情感、TF-IDF 和 Anew 在内的歌词特征,在 Deezer 情绪检测数据集(DMDD)(Delbouys 等人,2018)上用 4 种不同的回归模型预测效价和唤醒度(Russell,1980)分数。我们发现,在 11 个高层歌曲特征中,主要 5 个对性能有贡献;在预测效价时,多模态特征优于仅用音频。我们已公开我们的代码。

关键词

引用

@article{arxiv.2302.13321,
  title  = {Multi-Modality in Music: Predicting Emotion in Music from High-Level Audio Features and Lyrics},
  author = {Tibor Krols and Yana Nikolova and Ninell Oldenburg},
  journal= {arXiv preprint arXiv:2302.13321},
  year   = {2023}
}

备注

12 pages, incl. 2 pages appendix