中文

来自复调音乐录音的低资源音频到歌词对齐

声音 2021-02-19 v1 音频与语音处理

摘要

在长音乐录音中进行歌词对齐若以单次遍历执行可能会耗尽内存。在本研究中,我们提出了一种新颖的方法,无论音乐录音时长如何,都以低内存占用执行音频到歌词对齐。所提出的系统首先在音频信号中定位锚定词。相对于这些锚点,录音随后被分段,并执行第二遍对齐以获得词时间。我们表明,我们的音频到歌词对齐系统与最先进水平相比具有竞争力,同时需要少得多的计算资源。此外,我们利用我们的歌词对齐系统将音乐录音分割为句子级片段。尤其在分割后的录音上,我们报告了多个基准测试集上的歌词转写分数。最后,我们的实验突出了源分离步骤对于转写和对齐任务良好性能的重要性。为了可复现性,我们向研究界公开分享了我们的代码。

关键词

引用

@article{arxiv.2102.09202,
  title  = {Low Resource Audio-to-Lyrics Alignment From Polyphonic Music Recordings},
  author = {Emir Demirel and Sven Ahlbäck and Simon Dixon},
  journal= {arXiv preprint arXiv:2102.09202},
  year   = {2021}
}