基于自监督前端与线性Transformer的歌唱节拍跟踪
音频与语音处理
2022-09-01 v1
摘要
在没有音乐伴奏的情况下跟踪歌唱声部的节拍,可在音乐制作、自动歌曲编排和社交媒体交互中找到诸多应用。其主要挑战在于缺乏对一般音乐节奏分析十分重要的强节奏与和声模式。即使对人类听者而言,这也可能是一项具有挑战性的任务。因此,现有的音乐节拍跟踪系统在人声上无法提供令人满意的性能。在本文中,我们提出歌唱节拍跟踪这一新任务,并给出解决该任务的首个方法。我们的方法通过采用预训练的自监督WavLM和DistilHuBERT语音表征作为前端来利用歌唱声部的语义信息,并使用自注意力编码器层来预测节拍。为训练与测试系统,我们通过源分离和对完整歌曲的节拍跟踪获得分离的歌唱声部及其节拍标注,随后进行人工校正。在GTZAN数据集的741条分离人声轨上的实验表明,所提系统在节拍跟踪准确率方面大幅优于若干最先进的音乐节拍跟踪方法。消融研究也证实了预训练自监督语音表征相对于通用谱特征的优越性。
引用
@article{arxiv.2208.14578,
title = {Singing Beat Tracking With Self-supervised Front-end and Linear Transformers},
author = {Mojtaba Heydari and Zhiyao Duan},
journal= {arXiv preprint arXiv:2208.14578},
year = {2022}
}
备注
23rd International Society for Music Information Retrieval Conference (ISMIR 2022)