中文

流行音乐高亮提取器:标记情感关键点

音频与语音处理 2018-09-27 v2 人工智能 多媒体 声音

摘要

音乐高亮提取的目标是获取一首乐曲中一段简短的连续片段,以有效代表整首乐曲。在之前的工作中,我们针对流行歌曲引入了一种基于注意力的卷积循环神经网络,该网络将音乐情感分类作为音乐高亮提取的替代任务。该方法背后的原理是:歌曲的高亮部分通常是最具情感的部分。本文在以下两个方面扩展了我们先前的工作。首先,在方法学上,我们尝试了一种不需要任何循环层的新架构,使训练过程更快。此外,我们比较了后期融合变体和早期融合变体,以研究哪一种能更好地利用注意力机制。其次,我们开展并报告了一组广泛的实验,将所提出的基于注意力的方法与一种基于启发式能量的方法、一种基于结构重复的方法以及针对该任务的几种其他简单基于特征的方法进行比较。由于缺乏用于高亮提取的公共领域标注数据,遵循我们先前的工作,我们使用 RWC POP 100 首歌曲数据集来评估检测出的高亮与歌曲任何副歌部分的重叠情况。实验证明了我们的方法相对于竞争方法的有效性。为了可复现性,我们在 https://github.com/remyhuang/pop-music-highlighter/ 开源了代码和预训练模型。

关键词

引用

@article{arxiv.1802.10495,
  title  = {Pop Music Highlighter: Marking the Emotion Keypoints},
  author = {Yu-Siang Huang and Szu-Yu Chou and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:1802.10495},
  year   = {2018}
}

备注

Transactions of the ISMIR vol. 1, no. 1