基于 tempo 不变卷积神经网络的强拍跟踪
声音
2021-02-05 v1 机器学习
多媒体
音频与语音处理
摘要
人类跟踪音乐强拍的能力对速度变化具有鲁棒性,且可扩展到此前从未遇到过的速度。我们提出一种确定性时间扭曲操作,使卷积神经网络(CNN)具备该能力,令网络独立于速度学习节奏模式。与在训练数据集中现有速度上学习节奏模式的常规深度学习方法不同,我们模型中所学模式是 tempo 不变的,从而带来更好的速度泛化能力与更高效的网络容量利用。我们在使用 FluidSynth 渲染 Groove MIDI Dataset 构建的合成数据集上测试泛化性质,该数据集划分为含原始演奏的训练集与含不同 SoundFont 渲染的速度缩放版本的测试集(测试时增强)。所提模型对未见速度的泛化近乎完美(训练集与测试集 F-measure 均为 0.89),而可比较的常规 CNN 仅在训练集达到相似精度(0.89),在测试集降至 0.54。如 GTZAN 与 Ballroom 数据集上的结果所示,所提模型的泛化优势延伸至真实音乐。
引用
@article{arxiv.2102.02282,
title = {Downbeat Tracking with Tempo-Invariant Convolutional Neural Networks},
author = {Bruno Di Giorgi and Matthias Mauch and Mark Levy},
journal= {arXiv preprint arXiv:2102.02282},
year = {2021}
}
备注
7 pages, 5 figures, Proceedings of the 21st International Society for Music Information Retrieval Conference, ISMIR 2020