中文

基于自注意力机制的全局结构感知鼓点转写

声音 2021-05-13 v1 机器学习 音频与语音处理

摘要

本文描述了一种自动鼓点转写(ADT)方法,该方法直接从音乐信号估计 tatum 级鼓谱,而大多数传统 ADT 方法估计的是帧级鼓点起音概率。为估计 tatum 级鼓谱,我们提出了一种深度转写模型,该模型由用于从音乐信号提取潜在特征的帧级编码器和用于从在 tatum 级池化的潜在特征估计鼓谱的 tatum 级解码器组成。为捕捉鼓谱的全局重复结构(该结构难以用循环神经网络(RNN)学习),我们在解码器中引入了带有 tatum 同步位置编码的自注意力机制。为缓解自注意力模型因配对数据不足而难以训练的问题,并提升估计鼓谱的音乐自然度,我们提出了一种正则化训练方法,该方法使用从大量鼓谱集合中预训练的带自注意力机制的全局结构感知掩码语言(乐谱)模型。实验结果表明,所提出的正则化模型在 tatum 级错误率和帧级 F 值方面均优于传统的基于 RNN 的模型,即使在仅有少量配对数据可用、导致非正则化模型表现不如基于 RNN 的模型时也是如此。

关键词

引用

@article{arxiv.2105.05791,
  title  = {Global Structure-Aware Drum Transcription Based on Self-Attention Mechanisms},
  author = {Ryoto Ishizuka and Ryo Nishikimi and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2105.05791},
  year   = {2021}
}

备注

Submitted to Signals (ISSN 2624-6120)