迈向深度鼓声源分离
音频与语音处理
2024-05-21 v3 机器学习
声音
摘要
过去,由于数据可用性有限,鼓声源分离领域面临重大挑战,阻碍了在其他相关音频应用中取得成功的尖端深度学习方法的采用。在本文中,我们介绍了 StemGMD,这是一个包含孤立单乐器鼓音轨的大规模音频数据集。每个音频片段均使用十种逼真的声学架子鼓套件,从富有表现力的架子鼓演奏 MIDI 录音中合成。StemGMD 总计 1224 小时,是迄今为止最大的架子鼓音频数据集,也是首个包含标准九件套架子鼓中每种乐器孤立音频片段的数据集。我们利用 StemGMD 开发了 LarsNet,一种新颖的深度鼓声源分离模型。通过一组专用的 U-Net,LarsNet 能够以快于实时的速度从立体声鼓混合中分离出五个音轨,并且被证明显著优于最先进的非负时频分解方法。
引用
@article{arxiv.2312.09663,
title = {Toward Deep Drum Source Separation},
author = {Alessandro Ilic Mezza and Riccardo Giampiccolo and Alberto Bernardini and Augusto Sarti},
journal= {arXiv preprint arXiv:2312.09663},
year = {2024}
}
备注
9 pages, 2 figures, 3 tables. Published in Pattern Recognition Letters, vol. 183, pp. 86-91, 2024