中文

用于多基频估计的深度学习架构:面向可靠的评估

声音 2022-02-21 v1 机器学习 音频与语音处理

摘要

从音乐录音中提取基频信息是音乐信号处理中一项具有挑战性但重要的问题。逐帧转录或多基频估计旨在检测复调音乐录音中同时存在的基频活动,并且得益于深度学习技术,近期取得了重大进展,提出了多种网络架构。在本文中,我们实现了基于CNN、U-net结构和自注意力组件的不同架构。我们提出了对这些架构的若干修改,包括用于跳跃连接的自注意力模块、替代自注意力的循环层,以及同时预测复调度的多任务策略。我们在不同规模上比较了这些架构的变体在多基频估计中的表现,重点关注使用MusicNet和Schubert Winterreise数据集在钢琴独奏场景之外的西方古典音乐。我们的实验表明,大多数架构产生了具有竞争力的结果,且较大的模型变体似乎是有益的。然而,我们发现这些结果在很大程度上取决于随机效应和训练-测试划分的特定选择,这质疑了在仅有微小改进的情况下特定架构具有优越性的主张。因此,我们在存在作品套曲多个乐章的情况下研究了数据集划分的影响(跨版本评估),并为MusicNet提出了一种最佳实践划分策略,该策略削弱了单个测试音轨的影响并抑制了对特定作品和录音条件的过拟合。在混合数据集上的最终评估表明,在某一特定数据集上的改进不一定会推广到其他场景,因此强调需要更多高质量的多基频数据集,以可靠地衡量音乐转录任务的进展。

关键词

引用

@article{arxiv.2202.09198,
  title  = {Deep-Learning Architectures for Multi-Pitch Estimation: Towards Reliable Evaluation},
  author = {Christof Weiß and Geoffroy Peeters},
  journal= {arXiv preprint arXiv:2202.09198},
  year   = {2022}
}