中文

基于频谱比较的与音量无关的音乐匹配

声音 2022-07-01 v1 音频与语音处理

摘要

我经常听到一段音乐并想知道这首曲子的名字。事实上,存在诸如 Shazam 应用这样提供音乐匹配的应用。然而,这些应用的局限在于:若同一首由同一音乐家演奏的曲子不是同一录音,则无法被识别。Shazam 识别的是其录音,而非音乐本身。这是因为 Shazam 匹配的是音量的变化,而非声音的频率。本研究试图以人类理解音乐的方式来进行匹配:依据音乐的频谱,而非音量变化。本质上,其思路是预先计算数据库中所有音乐的频谱,然后取未知曲段并尝试将其频谱与数据库中每首音乐的每一片段进行匹配。我通过将未知曲段的频谱以 0.1 秒为步长滑动窗口与数据库匹配,并通过取绝对值、归一化音频、相减归一化数组以及取绝对差之和来计算误差。误差最小的片段被视为匹配的候选。匹配性能被证明依赖于音乐的复杂度。匹配简单音乐(如单音符曲子)是成功的。然而,更复杂的曲子(如肖邦的《叙事曲第四首》)并未成功,即该算法在数据库的任何音乐中均无法产生低误差值。我怀疑这与音符过多有关:高次谐波上的不匹配累积成显著误差,从而淹没了计算。

关键词

引用

@article{arxiv.2206.15426,
  title  = {Volume-Independent Music Matching by Frequency Spectrum Comparison},
  author = {Anthony Lee},
  journal= {arXiv preprint arXiv:2206.15426},
  year   = {2022}
}