中文

一种数据驱动的中层音乐感知特征建模方法

声音 2018-06-14 v1 音频与语音处理

摘要

音乐特征与描述符可粗略划分为三个复杂层级。底层包含音乐的基本构件,例如和弦、节拍与音色。中层包含由基本构件组合而浮现的概念:调性与节奏稳定性、和声与节奏复杂度等。高层描述符(流派、情绪、表现风格)通常使用低层特征建模。属于中层的特征既可改进高层描述符的自动识别,也可提供新的音乐检索可能。中层特征是主观的且通常缺乏明确定义。然而,它们对人类音乐感知非常重要,且其中某些特征人们可达较高一致性,尽管定义它们并因此设计手工特征提取器可能困难。本文中,我们从数据导出中层描述符。我们收集并发布了一个由音乐家标注了七个中层描述符的 5000 首歌曲的数据集\footnote{https://osf.io/5aupt/},即旋律性、调性与节奏稳定性、调式、节奏复杂度、不协和度与发音法。随后我们比较了几种利用深度学习从谱图预测这些描述符的方法。我们还以音乐情绪识别为应用展示了这些中层特征的有用性。

关键词

引用

@article{arxiv.1806.04903,
  title  = {A data-driven approach to mid-level perceptual musical feature modeling},
  author = {Anna Aljanaki and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:1806.04903},
  year   = {2018}
}

备注

7 pages, ISMIR conference paper