用于帧级乐器识别的多任务学习
声音
2019-02-19 v2 音频与语音处理
摘要
对于许多音乐分析任务,我们需要知道多乐器乐曲中每个时间帧的乐器存在情况。然而,这种帧级乐器识别任务仍然困难,主要由于缺少带标签的数据集。为解决此问题,我们在本文中给出一个大规模数据集,其包含具有帧级音高与乐器标签的合成复调音乐。此外,我们提出一种简单而新颖的网络架构,以联合预测每一帧的音高与乐器。通过这种多任务学习方法,音高信息可被用来预测乐器,反之亦然。并且,通过使用所谓的钢琴卷帘(pianoroll)音乐表示作为模型的主要目标输出,我们的模型还能预测演奏各个音符事件的乐器。我们通过将其与单任务消融版本以及三种 SOTA 方法进行比较,验证了所提方法在帧级乐器识别上的有效性。我们还展示了所提方法在真实世界音乐多音高流化(multipitch streaming)上的结果。为可复现性,我们将在 https://github.com/biboamy/instrument-streaming 分享抓取数据与实现所提模型的代码。
引用
@article{arxiv.1811.01143,
title = {Multitask learning for frame-level instrument recognition},
author = {Yun-Ning Hung and Yi-An Chen and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:1811.01143},
year = {2019}
}
备注
This is a pre-print version of an ICASSP 2019 paper